一张图看懂「上下文窗口」:模型的短期记忆
你跟 AI 聊着聊着,它好像“忘了”开头说了啥;或者你贴了超长文档,它说装不下。这都和上下文窗口(Context Window)有关。
一、它就像模型的“短期记忆”
大模型一次能同时“看到”的文本量是有限的,这段能容纳的 Token 总数,就是上下文窗口。
把它想成一张便签纸:纸上能写下的字有限,写满了要么擦掉旧的、要么就写不下新的。纸越大(窗口越长),它一次能记住的对话和资料越多。
二、窗口里装了什么
它包含:你这次的提问、之前的对话历史、_system 设定、模型要生成的回答——全算在一起,不能超。
三、满了会怎样、怎么办
- 超了装不下:超出的部分被截断,模型“看不见”更早的内容,于是显得健忘。
- 应对:长对话可以摘要前文、只留关键信息;长文档靠 RAG 只取相关片段,而不是整篇塞进窗口。
- 窗口越大越贵越慢:能装更多,但也更费算力和钱,并非越大越好。
一句话:上下文窗口是模型一次性能“装进脑子”的文本上限,像一张容量有限的便签纸;对话变长或文档超长时,要学会摘要和检索,别硬塞。