Skip to content

0.2 LLM 在做什么事

从你发一条消息开始

你向 Claude 发了一段话,比如"帮我写一个登录页面"。在你看到回复之前,发生了什么?

第一步:把你的话变成数字

AI 看不懂文字,只能处理数字。你的话首先被切成一个个小片段,叫做 Token(词元),每个 Token 对应一个数字编号。

"帮我写一个登录页面"
→ ["帮", "我", "写", "一个", "登录", "页面"]  (大概这样分)
→ [1823, 492, 7731, 256, 3847, 9012]  (每个对应一个数字)

💡 类比:就像电报里把文字转成莫尔斯码,AI 把文字转成它能处理的数字序列。


什么是 Token

Token 是 AI 处理文字的最小单位,但它不等于一个字或一个单词

  • 英文里,一个单词可能是一个 Token,也可能被切成几个 Token
  • 中文里,每个汉字大概是 1-2 个 Token
  • 标点符号、空格也是 Token

为什么你需要理解 Token?

因为 AI 的很多限制都和 Token 直接相关:

  • 上下文窗口(Context Window) 就是以 Token 数量计算的
  • 费用 是按 Token 数量计费的
  • 响应速度 取决于生成了多少 Token

⚠️ 常见误解:很多人以为"上下文 200k"是指 200k 个字。实际上是 200k 个 Token,中文大概是 10-15 万个汉字。


什么是上下文窗口

AI 每次处理对话,都有一个"工作内存"的上限,就是上下文窗口(Context Window)

想象 AI 是一个人,正在处理你们的对话。但这个人有一个特殊限制:它只能看到桌面上的一叠纸,纸放满了,最早的就会滑落看不见。

[系统提示] + [历史对话] + [你的新消息] + [AI 的回复]
          ↑ 这些加起来不能超过上下文窗口的上限

这就是为什么:

  • 对话太长之后,AI 会"忘记"前面说过的事
  • 给 AI 塞入太多文件,它处理质量会下降
  • Agent 执行复杂任务时,上下文爆满是一个常见的失控原因

AI 怎么生成回复

理解了 Token,我们来看 AI 怎么生成回复。

它不是先想好整段话再打出来,而是一个 Token 一个 Token 地预测

  1. 看当前所有内容(你的消息 + 历史对话)
  2. 计算"下一个 Token 最可能是哪个词"(列出所有候选词,每个词分配一个可能性分数)
  3. 根据概率选一个 Token
  4. 把这个 Token 加入内容,重复第 1 步

这个过程一直持续,直到生成了"结束"信号。

这就解释了为什么 AI 是流式输出的——因为它本来就是一个词一个词生成的,不是先有整段文字再传给你。


既然只是"预测下一个词",它怎么会分析、会做不同的任务?

这是几乎所有人都会卡住的地方:预测下一个词听起来这么笨,它怎么能翻译、写代码、做总结?

一句话先说核心:"预测下一个词"要做到极致,模型被逼着学会了文字背后的规律;而你的提示词,决定了它从这些规律里调取哪一块。

1. 要"预测得准",就不得不懂规律

想想补全这几句的最后一个词:

  • "小明把杯子摔在地上,杯子碎了,地上全是____" → 要填对"水/玻璃碴",得"知道"杯子会摔碎、会洒
  • "因为 3 × 7 = ____" → 要填"21",得学会乘法
  • "这段代码报 IndexError,因为____" → 要填对,得"懂"列表越界

⚠️ 常见误解:"预测下一个词"不是鹦鹉学舌。正因为要预测得准,模型在训练时被迫把文字背后的规律(事实、推理、代码语义)学了进去。 能力是"预测"这个目标的副产品。

2. 提示词 = 给预测引擎设定的"目的地"

模型每一步只问自己:"给定前面这一整段文字(包含你的全部提示词),下一个词最可能是什么?" 提示词一变,"最合理的续写"就完全变了:

你的输入开头训练数据里这种开头后面通常跟着于是模型续写出
把下面的话翻成英文:你好英文译文Hello
解释这段代码:for i in…一段中文讲解代码解释
给我写首关于秋天的诗诗句一首诗

💡 类比:同一台导航引擎,输入不同目的地,算出完全不同的路线。模型的预测引擎是固定的,提示词就是你输入的目的地——它把引擎导向"该这么接话"的某一类模式。所谓"不同的分析处理",其实是不同提示词激活了模型学过的不同规律。

3. 一次一个词,怎么变成一整段有条理的分析?

因为它把自己刚写出的词也当成输入,再预测下一个,像滚雪球:

解释什么是递归 → "递" → "归" → "是" → "指" → …… 一路接到写完

每一步都"看着到目前为止的全部内容"再往下接,所以整段连贯有逻辑。它不是先想好答案再写,而是边写边定。这也解释了为什么让它**"先写思路再给结论"(思维链)会更准**——把推理过程写出来,等于给后面的预测铺好了更靠谱的前文。

4. 它为什么"听指令"而不是接着补全指令?

这来自训练的第二阶段 SFT(监督微调):用海量"指令 → 理想回答"的配对喂它,让"看到一条指令"后最可能的续写,变成"一段合规的回答"。所以连"听话"也是学出来的预测习惯(详见 3.3 模型是怎么训练出来的)。


这一切是"喂"出来的——但它学的是规律,不是背诵

那这些规律从哪来?就是海量数据 + 这套训练方式的结果。 但这里有个关键的、必须拧准的点:

⚠️ 常见误解:以为"它把海量数据都存进去了,用时查一下"。不是。 数据量大到根本装不进模型参数(好比把整个互联网塞进几百 GB,物理上不可能)。正因为装不下,模型被逼着总结规律,而不是死记原文

💡 类比:一个学生刷了几百万道题。只背答案——遇到没背过的新题就废了;但题太多背不完,他只能悟出解题方法,于是全新的题照样能做。大模型是后者:它没"记住"你这句话(你这句它多半没见过),但学会了语言/逻辑/代码怎么运转,所以能处理没见过的输入。

而且光有数据还不够,是三样东西凑齐才有今天的大模型:

海量数据             → 规律藏在里面的原材料
+ 合适的架构(Transformer/注意力)→ 让它一次看全上下文、抓住词与词的关系(见 3.1/3.2)
+ 预测下一个词的训练目标          → 逼它把规律学出来
+ 之后的 SFT / RLHF              → 教它听话、对齐人的偏好(见 3.3)
————————————————————————————
= 你现在用的大模型

它学到的是规律、不是原文——这一点同时解释了两件看似矛盾的事:为什么它能举一反三处理新问题,又为什么会一本正经地胡说(幻觉)。下面就说幻觉。


为什么 AI 会"幻觉"

"幻觉"是指 AI 一本正经地说出错误的事实,比如编造一个不存在的论文引用、给出错误的代码。

原因就在于它的工作机制:它在预测"听起来最合理的下一个词",而不是"最真实的下一个词"

当你问一个它不确定的问题,它不会说"我不知道",而是会生成"听起来最像答案的话"——因为那才是它训练出来的模式。

💡 类比:让一个从来没去过某个城市的人,给你描述那里的街道。他可能会结合其他城市的记忆,编出一段听起来很合理的描述,但具体细节可能是错的。


📌 关键结论

  1. AI 把文字切成 Token 处理,Token 数量决定了费用和上下文限制
  2. 上下文窗口是 AI 的"工作内存",超出了就会"忘事"
  3. AI 是一个 Token 一个 Token 流式生成的,不是先想好再说
  4. "预测下一个词"要做到准,就得学会规律——能力是这个目标的副产品;提示词则决定它调取哪一块规律
  5. 它是海量数据喂出来的,但学的是规律、不是背诵原文(刷题悟方法,不是背答案)——这同时解释了"举一反三"和"幻觉"
  6. 幻觉的根本原因是"预测合理内容"而不是"确认真实内容"

下一节:0.3 AI 能做什么,不能做什么

写给自己的 AI 学习地图