什么是 Token 和上下文窗口?一文看懂 AI 的记忆和胃口
AI 为什么按 Token 计费、聊久了会忘、长文会截断?一文用大白话讲清 Token(词元)和上下文窗口是什么,以及怎么用好它省钱又高效。
用 AI 用久了,你可能会撞见几个奇怪的词:「这个模型上下文窗口 128K」「按 Token 计费」「对话太长它就忘了前面」。这些到底啥意思?其实它们都指向 AI 的两个底层概念——Token(词元)和上下文窗口(Context Window)。搞懂这俩,你就明白了 AI「怎么读你的话」「一次能记多少」「为什么会忘」「为什么按量收费」。这篇用大白话讲透。

Token 是什么:AI 眼里的「字块」
Token(词元),是 AI 处理文字的最小单位。AI 并不是一个字一个字地读,而是把文字切成一个个「Token」来处理。一个 Token 可能是一个词、一个字,或一个词的一部分。
大致的换算感觉(因语言和模型而异):
- 英文:1 个 Token ≈ 约 4 个字符,或约 0.75 个单词;
- 中文:1 个汉字大致相当于 1~2 个 Token。
打个比方:如果说文字是一串珠子,Token 就是 AI 把珠子分组后的一个个「小段」——它是按「段」来读和算的,不是按单个珠子。
为什么你要关心 Token
- 它是「计费单位」:很多 AI(尤其是 API)按 Token 数收费,输入 + 输出的 Token 越多越贵。
- 它是「容量单位」:模型「一次能处理多少内容」,是用 Token 数来衡量的(见下文上下文窗口)。
所以你发的字越多、让它输出越长,消耗的 Token 就越多——这既影响成本,也关系到它「装不装得下」。
上下文窗口是什么:AI 一次的「记忆容量」
上下文窗口,是 AI 一次对话中能「看到」和「记住」的 Token 总量上限。你可以把它理解为 AI 的「工作台大小」或「短期记忆容量」——你发的所有内容 + 它之前的回复,全都要摆在这张台子上;台子就那么大,摆满了,最早的东西就得被挤下去。
常听到的「128K 上下文」,意思就是这个窗口能容纳约 12.8 万个 Token。窗口越大,AI 一次能处理的内容越多(比如能读更长的文档、记住更长的对话)。

这解释了几个你遇到过的现象
| 现象 | 原因 |
|---|---|
| 聊太久它「忘」了前面说的 | 对话总长超出了上下文窗口,早期内容被挤出去了 |
| 长文档处理不全 / 截断 | 文档 Token 数超过了窗口容量 |
| API 用起来花钱 | 按输入+输出的 Token 计费 |
| 同样的问题,有的模型答得「记性更好」 | 它的上下文窗口更大 |
怎么用好这两个概念(实用建议)
- 长对话适时「总结续接」:聊得很长时,让 AI 先总结前面的要点,再基于总结继续——相当于给记忆「打包压缩」,减轻窗口压力。
- 处理长文档分段喂:文档太长超窗口时,分章节处理,或先提取关键部分(这也是 《用 AI 读长文档》 里的技巧)。
- 别塞无关内容:只给相关的信息,既省 Token(省钱)、又让它更聚焦、答得更准。
- 重要信息适时「重申」:长对话里,关键设定隔一段重新说一遍,防止它被挤出窗口后「忘」掉。
小结
- Token 是 AI 处理文字的最小单位(约等于「字块」),既是计费单位也是容量单位;
- 上下文窗口是 AI 一次能记住的 Token 上限,相当于它的「短期记忆容量 / 工作台大小」;
- 它解释了:聊久了会忘、长文会截断、API 按量收费、模型「记性」有差异;
- 用好它:长对话总结续接、长文分段、别塞无关内容、关键信息重申。
Token 和上下文窗口,是理解 AI「能力边界」的两把钥匙。搞懂它们,你就不会再对「AI 怎么忘了」「为什么这么贵」感到困惑,也能更聪明地安排你和 AI 的每一次对话——把有限的「记忆」和「预算」,都花在刀刃上。
本文为「读懂 AI」原创,Token 换算与上下文窗口大小因模型而异,具体以各模型官方说明为准。