Skip to content

速记卡

每章浓缩成几张卡片:一句话核心 + 类比 + 最容易错的点。用于碎片时间快速唤起记忆——读不懂的,点链接回正文。


第 0 章 · 认知

🃏 LLM 在做什么

核心:预测下一个 Token,不是"思考"。 类比:超强版输入法联想。 易错:以为它"理解",其实它匹配的是词语模式 → 这解释了幻觉、换问法结果差。

🃏 能力边界

核心:擅长模式匹配与变换;不擅长精确计算、实时信息、持久记忆、稳定复杂推理。 掌控本质:把任务设计成它擅长的形式,用工具补它不擅长的。 易错:让它直接算数 / 凭记忆答最新信息 → 应该给工具。

🃏 国产生态

核心:国内做工程优先国产模型(便宜、稳、中文强、多兼容 OpenAI 协议)。 选型:主力 DeepSeek,补位阿里百炼(Embedding/多模态)。


第 1 章 · LLM 工程

🃏 Token 与上下文

核心:Token 是计费和上下文的基本单位;上下文窗口 = 工作内存,超了就忘事。 易错:上下文大 ≠ 全被认真处理("中间迷失")。重要信息放开头/结尾或 System Prompt。

🃏 Prompt 工程

核心:角色 + 任务 + 上下文 + 格式 + 约束。Few-shot 给范例最有效,CoT 让难题更准。 易错:追"魔法咒语"。真正有效的是把任务设计成 AI 擅长的样子。

🃏 生成参数

核心:temperature 低=稳定、高=发散;代码 0.2,对话 0.7,创意 1.0。 易错:temperature 和 top_p 一般不要同时大改。

🃏 Tool Use

核心:AI 不执行代码,只发"调用请求",你的代码执行后把结果喂回去,循环到结束。 易错:工具出错不反馈给 AI → 它会假设成功继续跑偏。Description 写不清 → 用错工具。

🃏 推理模型

核心:先想再答,靠 test-time compute 换准确率;难题强,但慢且贵。 易错:无脑全用。默认普通模型,搞不定再上推理模型。

🃏 OpenAI 兼容协议

核心:换模型只改 baseURL + apiKey + model,业务代码不变。 易错:Embedding 不能跨模型混用;Anthropic SDK 是另一套协议。

🃏 多模态生成(图像/视频)

核心:输出侧多模态,不走 chat.completions;国产平台多为"提交任务→轮询 task_id"异步模式。 易错:返回 URL 是临时的,拿到立刻转存;按张/按秒计费远贵于文本,要限额 + 合规审核。

🃏 语音与实时(ASR/TTS)

核心:语音对话=ASR(听)→LLM(想)→TTS(说)流水线,多为三段拼接。 易错:延迟是头号敌人,三环都走流式 + 并行;本地敏感音频用 Whisper。

🃏 自托管推理部署

核心:生产扛并发别用 Ollama,换 vLLM(连续批处理+PagedAttention),同卡吞吐高几倍到几十倍;提供 OpenAI 兼容接口,代码不用改。 易错:显存=权重+KV Cache,KV Cache 随并发/上下文涨最易 OOM;多数情况云 API 更划算,别忘算运维成本。

🃏 结构化输出

核心:让 AI 可靠输出可被代码处理的 JSON;可靠性递增:纯 Prompt(5-15% 失败)→ json_object(1-3%)→ JSON Schema strict(<0.1%)。 类比:失败时把错误内容反馈给模型让它自修正,比盲目重发同一请求有效得多;最多重试 2 次。 易错:只靠 Prompt 约定格式在生产里不可靠;结构化输出和流式通常互斥,要分开处理。

🃏 Embedding 模型选型

核心:中文场景优先选中文语料足的模型(bge-m3、阿里百炼),不要默认用 OpenAI;bge-m3 是稳健全能选手:多语言强、本地运行免费。 类比:维度不是越高越好——768-1024 维在百万级文档内完全足够,高维只会增加存储和检索成本。 易错:只看 MTEB 榜单;一定要在自己的数据上测 Recall@3,不同业务数据排名可能大不相同。


第 2 章 · 构建产品

🃏 RAG

核心:先检索相关文档,再让 AI 基于它生成回答。解决知识固定/实时性问题。 易错:效果差先查分块,别急着换模型。分块大小 + 重叠很关键。

🃏 Agent 失控

核心:推理雪崩、上下文污染、错误未处理、任务歧义、规则稀释。 最有效的防失控:System Prompt 里写"遇到不确定就停下来问,别假设"。

🃏 评估

核心:为你的具体场景建自己的评估集,每次改动跑一遍看数字。 易错:只看通用 Benchmark,对你的场景没意义。

🃏 可观测性

核心:三层——基础指标(延迟/Token/成本)、链路追踪(traceId 串起多步)、质量监控(线上抽样评估)。 易错:质量会无报错地悄悄退化;延迟看 P95/P99,平均值会骗人。

🃏 安全上线

核心:评估集变成每次改动都跑的回归测试 → 接 CI → 灰度/影子 → 锁模型版本可回滚。 易错:改 Prompt/换模型"代码没动行为也会变",没基线对比不知道是改好还是改坏。

🃏 AI 产品 UX

核心:AI 的响应慢、结果随机、偶尔出错,决定了它需要专门的 UX——流式输出/分层加载状态/友好错误提示/高风险确认点。 类比:流式输出是"电梯里的镜子"——不让 AI 更快,但让用户感知等待减少 40-60%。 易错:取消按钮要在首字节之前就显示;人工确认只对不可逆操作加,频繁低风险确认会让用户养成无脑点击习惯。

🃏 语义缓存

核心:用向量相似度代替精确匹配,让"怎么退款"和"退款流程是什么"命中同一条缓存,高频知识类问答可节省大量 LLM 调用。 类比:阈值从 0.92 开始调——太低把"退款"和"换货"混淆答错,太高命中率接近零。 易错:与 Prompt Caching 是不同层的优化(前者跳过整个 LLM 调用,后者让单次调用更便宜);不适合创意生成或结果需要个性化的场景。

🃏 限流重试熔断

核心:重试要分类——400/401/422 不重试(先修 Bug),429/500/503/504 才重试;指数退避 + 抖动防多客户端同时打爆服务器。 类比:熔断器像保险丝——服务持续故障时主动断路,防止无限重试耗尽调用方资源,触发后切降级路径给用户友好提示。 易错:AI API 有 RPM 和 TPM 双维度限额同时生效,容易只注意其中一个;批量任务控制并发,不要无限并发。

🃏 Guardrails 防护

核心:输入防护 + 输出防护 + 行为防护三层,用确定性代码校验 AI 输出,把 AI 当成"初稿"而非最终结果。 类比:过滤强度按场景分级:儿童/政府用 STRICT,通用企业用 STANDARD,专业工具用 RELAXED。 易错:靠 Prompt 里写"不要..."来防注入是最弱的防线;核心是最小权限 + 确定性输出校验,规则搞不定的再上 LLM-as-Guardrail。

🃏 对话设计

核心:多轮对话四大难题:信息不完整、表达有歧义、改变主意、上下文积累;槽位填充是任务型对话的核心模式(定义槽位 → 逐步收集 → 填满执行)。 类比:歧义不是每次都要追问——高风险问、中等风险猜 + 说明假设、低风险直接做。 易错:槽位更新用合并而非覆盖,已填的不要因新消息没提就清空;转人工是对话 AI 的重要功能,不是失败。

🃏 AI 测试工程

核心:三层——不调 LLM 的单元测试 → 黄金数据集评估(mustContain/mustNotContain 柔性匹配)→ 线上监控,建立量化质量基线。 类比:Prompt 改动接 CI,和黄金数据集评估放进同一流程,每次改动量化"是否变好了"。 易错:LLM-as-Judge 评事实准确性不可靠(倾向给"听起来自信"的高分),评语气和格式更准;10 条高质量测试用例比 200 条低质量更有价值。

🃏 数据飞轮

核心:产品运行 → 收集用户信号 → 分析 bad case → 改进(Prompt/测试集/微调)→ AI 质量提升的闭环。 类比:隐式信号(立刻重试、复制输出、放弃对话)比显式点赞/踩更真实更多量;改进速度:更新 Prompt(最快)> 扩充测试集 > 构建微调数据集。 易错:不需要全部搭好才开始;最小可行飞轮只需一个反馈按钮 + 一张记录表 + 每周看一次。


第 3 章 · 原理

🃏 Transformer / Attention

核心:每个词同时"看到"所有词,动态决定关注谁。 推论:上下文越长,计算量按平方涨(更贵更慢);注意力被稀释。

🃏 训练三+一阶段

核心:预训练(学语言)→ SFT(学听话)→ RLHF(学价值观)→ 推理训练(学思考)。 :AI 的"性格"来自 SFT 数据 + RLHF 偏好。

🃏 Fine-tune vs RAG

核心:动态知识/事实 → RAG;固定风格/格式/任务 → Fine-tune。 铁律:别用 Fine-tune"注入知识";先把 Prompt 做到位再考虑 Fine-tune。

🃏 位置编码与长上下文

核心:位置编码告诉模型词序,没有它 Transformer 无法区分先后;RoPE 是现代主流,支持长上下文外推;"支持 128k"≠"整个 128k 都被充分注意"。 类比:"Lost in the Middle"——关键信息放中间,准确率从 80% 降到 40-50%;把核心指令放开头、最相关文档紧邻用户问题。 易错:Attention 计算量是 O(N²),长上下文成本不是线性增长;能用 RAG 精准召回就不要堆超长上下文。

🃏 量化与模型压缩

核心:量化 = 把高精度浮点数压缩成低精度整数,7B 模型从 28GB 压到 4-5GB;Q4_K_M 是消费级 GPU 的推荐默认选择,大多数任务质量损失可接受。 类比:温度计精确到小数点后 4 位,天气 App 显示整数,对"穿什么衣服"没影响;K-quants 对重要参数保留更高精度。 易错:越小不等于越快(速度取决于内存带宽而非模型大小);Q2 开始明显变差,Q8 几乎无损。


第 4 章 · MCP 与 Agent 生态

🃏 MCP

核心:AI 与工具之间的标准协议,工具写一次到处可用(Tools/Resources/Prompts 三种能力)。 配置claude mcp add,作用域 local / project(.mcp.json) / user。

🃏 多 Agent

核心:适合并行/超长/专业分工;Handoff 信息要传完整,用文件共享状态最可靠。 原则:从单 Agent 开始,按需引入,别过度设计。

🃏 Harness 脚手架

核心:Agent = Model + Harness,表现一大半来自模型外的挽具。 比喻:模型是烈马,Harness 是挽具+缰绳+车夫。模型负责聪明,Harness 负责靠谱。 零件:控制流、错误恢复、反馈回路、计划追踪、动态强度、补偿性代码。

🃏 上下文工程

核心:上下文窗口=办公桌桌面,每步只放此刻最该看的东西。 四手法:按需注入(用时才放)、压缩(旧的摘成便签)、隔离(子任务另开桌只回传结论)、文件柜(长期信息写进 Workspace 文件,随用随取)。 :上下文是临时桌面、Workspace 文件是持久文件柜;Agent 失控防不住时,往往是该用 SOP/流程清单显式约束步骤。

🃏 长期记忆

核心:短期=上下文(会话即清),长期=外部存储(跨会话),靠"检索后注入"连接,本质是对记忆的 RAG。 易错:别全塞进上下文;只记有长期价值的,处理好冲突更新,给用户删除权(隐私)。

🃏 Computer Use

核心:让 Agent 看屏幕、点鼠标键盘,操作没有 API 的软件;浏览器任务优先走 DOM 路线(比截图猜坐标稳)。 易错:慢/贵/易错;必须沙箱隔离 + 对付款/删除等不可逆动作人类确认;有 API/MCP 就别用它。

🃏 工作流编排

核心:Workflow 适合逻辑可预测的多步任务(支持并行/条件分支/人工介入/断点续跑),与 ReAct 互补——外层 Workflow,每个节点内部可以是小 ReAct Agent。 类比:核心结构是节点(任务单元)+ 边(流向)+ 共享状态(黑板);四种基本模式:顺序/条件分支/并行/带检查点循环。 易错:不是所有任务都要 Workflow;先用 ReAct 验证可行性,发现需要确定性分支或并行时再提取成 Workflow 节点。

🃏 代码执行沙箱

核心:AI 生成的代码必须在沙箱里执行;Node.js 原生 vm 不安全(可逃逸),生产用 Docker(OS 级隔离)或 E2B(托管沙箱)。 类比:静态检查是第一道门,沙箱是第二道门,两者必须叠加;四道限制缺一不可:超时/内存上限/禁网络/禁文件系统。 易错:直接 eval() 或原生 vm 都可被绕过;聪明的代码可以拼接字符串绕过正则检查,靠 Prompt 约束不安全。

🃏 多模态 Agent

核心:把视觉理解封装成 Agent 工具,让 Agent 自主决定何时"看图",处理截图/图表/扫描件等纯文字 Agent 无法处理的输入。 类比:同一请求可传多张图(最多 20 张),适合版本对比和多页分析;图像按 Token 计费,高分辨率图先压缩再发送。 易错:视觉 AI 强项是语义理解而非像素精确;需要精确坐标/颜色值时用 Computer Use 或传统图像处理库,不要用视觉理解 API。

🃏 角色演进(Loop / Graph Engineer)

光谱:Prompter(驾驭一句话)→ Context Engineer(一张桌面)→ Loop Engineer(一个循环)→ Graph Engineer(一张图);四层嵌套非替代,上层出问题病根常在下层。 Loop:设计"目标→执行→验证→纠偏"闭环,验证环节优先于重试次数。 Graph:三件套 Node 切分 / Edge 流转 / State Schema;State 四原则——最小化、类型约束、按写入方分片、显式合并(reducer)。

🃏 极简 Harness(Pi)

核心:Pi=开源极简 Agent Harness,哲学"Primitives, not features"——Sub-agents/Plan mode 不内置,用 TS 扩展自己造;Harness 本身可被 Agent 改造(改完 /reload 生效)。 亮点:树状会话历史(/tree 回退分叉,会话即数据);四种模式(交互/Print/RPC/SDK);AGENTS.md+SYSTEM.md+可替换 Compaction=上下文工程机制化。 选型:把活干完用全配齐(Claude Code),打造工具用可编程底座(Pi)。


第 5 章 · 深入与落地

🃏 RAG 深入

检索不准:问题≠答案的形态 → 查询改写/HyDE/多路召回/父文档。 文档处理:抽取分流(能复制别OCR)、按结构分块、上下文检索(块前加背景)。 评估:检索层(Recall@k) + 生成层(忠实度);防幻觉=无依据不答+强制引用。 进阶范式:全局/关系型问题→GraphRAG(建知识图谱);含糊/多步查询→Agentic RAG(检索做成工具自主多轮)。先把朴素RAG+重排做到位再上。

🃏 MCP 深入

能力:Tool(做动作)、Resource(只读数据)、Prompt(模板) + Sampling/Elicitation。 生产:Streamable HTTP + OAuth(别手搓) + Inspector 调试。 选型:要能力跨客户端用 MCP,自己App用Tool,要流程用Skill,确定流程写代码。

🃏 Skill 开发

本质:文件夹 + SKILL.md(+脚本+资源),不是斜杠命令。 渐进披露:平时只记目录(name+desc)→激活读正文→按需看附录/跑脚本。 关键:description 即触发条件,要写清"做什么+什么时候用"。

🃏 模型微调

80%在数据:ChatML JSONL,assistant 是要学的标准输出;质量>数量、要一致、留验证集。 路径:云端(百炼SFT,省事) / 本地(LoRA→GGUF→Ollama,注意 chat template 一致)。 决策:先穷尽 Prompt/RAG,确实卡在格式/风格/专项准确率才微调。 检索侧:召回不准先加通用 Reranker(性价比最高、不动索引),领域术语特殊才微调 Embedding(换模型要重算全库向量);难负样本质量决定效果。

🃏 Text-to-SQL

核心:Schema 注入质量是准确率最大变量(字段注释越清晰越准);安全校验必须用确定性代码(白名单/正则),绝不能直接执行 AI 生成的 SQL。 类比:用只读账号 + 只读副本 + 强制 LIMIT 三层权限兜底;把数据库报错反馈给 AI 自修复,比直接报错给用户成功率高得多。 易错:靠 Prompt 里写"不要生成危险 SQL"防不住注入;不建评估集量化 Execution Accuracy,靠感觉判断迟早翻车。

🃏 DSPy 自动化 Prompt 优化

核心:把 Prompt 优化从"靠人的直觉"变成"靠评估数据自动选最优指令和 Few-shot 样例";评估集是自动优化的唯一指北针。 类比:深度学习里你写架构,优化器找权重;DSPy 对 Prompt 做同样的事——你定义签名 + 指标,自动找最优提示词;核心思想不依赖框架,可独立使用。 易错:没有评估集 APO 没有方向;不要跳过手工迭代阶段,先手工到瓶颈再引入自动化。


第 6 章 · 提示词工程

🃏 提示词心法与写法

本质:设定情境,让你要的答案成为最可能的续写(非下命令)。四杠杆:缩范围/对齐形态/引导路径/给范例。 结构:七部件;指令在前、数据在后、分隔符圈数据;正面指令>负面。 技巧:CoT 给普通模型(推理模型别塞);Few-shot 选例含易错、格式一致。

🃏 输出控制与稳定

控制:格式给范例+json_object;长度给结构非字数;强制引用 + 允许说"不知道"。 稳定:治幻觉/边界输入/注入/随机性;防注入靠分隔标注+权限校验兜底;该确定就低温。 迭代:当代码——建测试集、改一处、全量跑、看数字;改不动就换方案(拆/微调/RAG/代码)。

🃏 场景 Playbook 速记

信息处理:分类给定义+易错范例;抽取给schema+不编造;摘要忠实原文;改写给风格范例。 代码:贴完整报错+先病因后改+最小改动;生成给上下文+风格范例。 对话/RAG/Agent:固定规则进System+拒答出口;RAG强制引用+没有就说没有;工具"出错停、不确定问"。 模型差异:推理vs普通提示相反;换模型要重测。


下一页:自测题库

写给自己的 AI 学习地图