京
京峰教育 · 技术藏书阁
+ 上传书籍
自研教材
藏书阁首页
/ AI科技
AI科技
LLM大模型技术入门
项目编号
07-LLM大模型技术入门.docx
1
卷文档
25.1
万字
641
章
我是吴光科。先跟你交代一下我的来路,因为这本书里的每一个比喻、每一句大白话,都跟这段来路有关。
📖 开始阅读
1
卷文档
641
总章节
25.1
万字
选择卷册
同一项目 · 多卷文档
全文
《全文》
251227 字 · 641 章
📖 开始阅读
第 1 章 从"会说话的机器"说起——大模型到底是什么
第 2 章 大模型怎么"看懂"文字——分词、向量与语义
第 3 章 Transformer 与注意力机制——大模型的大脑
第 4 章 预训练——大模型是怎么"读万卷书"的
第 5 章 微调与指令跟随——从"懂语言"到"听你话"
第 6 章 RLHF 与人类对齐——让 AI 说人话、不胡来
第 7 章 推理、幻觉与上下文——大模型会犯什么错
第 8 章 国产大模型版图与普通人怎么选
后记
自序
我是谁:一个从大山里走出来的"敲命令的人"
为什么一个搞运维的,来写"大模型原理"
这本书是被问出来的
这本书想干什么
读这本书,你能得到什么
一张地图:从"预测下一个字"这句话出发,把分词、向量、Transformer、注意力、预训练、微调、RLHF、推理、幻觉、上下文,这一整套东西串成一条线。你看 AI 新闻、听行业吹牛时,不会再云里雾里。
一份底气:知道它强在哪、弱在哪,你就不会被"AI 神化"忽悠,也不会被"AI 恐惧"吓倒。该用它的时候放心用,该防它的时候知道防。
一套方法:每一章结尾都有"今日一练"、都有"一句话记住"、都有"避坑"提醒,还有可以跟着敲的命令。读完不白读,能上手。
一次体验:我们会在书里的实验服务器上,真的把一个"迷你大模型"(Qwen2.5-0.5B)跑起来,让它现场给你生成一段话。你亲眼看到它是怎么"蹦字"的,比听我说一百句都管用。
你可能会问我的四个问题
怎么读这本书
这本书写给谁
关于书里的"动手实验"
几句心里话
年
第 1 章 从"会说话的机器"说起——大模型到底是什么
1.1 一句话定义:大模型是"超级概率机器"
1.1.1 先说"预测下一个字"是什么感觉
1.1.2 关键是"概率"两个字
1.1.3 "跟它聊天"到底发生了什么
1.1.4 它凭什么能"举一反三"
1.1.5 大模型家族:对话式、推理式、多模态
1.2 它"大"在哪:三个维度
1.2.1 数据大
1.2.2 参数大
1.2.3 算力大
1.2.4 三个"大"背后的真实含义
1.2.5 参数不是越多越好:规模与性价比
1.2.6 关于"大模型"和"AI"的关系
1.3 它和"以前的 AI"有什么不同
1.3.1 四个时代的对比
1.3.2 前三个时代的问题
1.3.3 大模型的时代:通用
1.3.4 "通用"带来什么:从工具到协作者
1.4 国产大模型:你手机里就有
1.4.1 主要玩家速览
1.4.2 为什么我非要提国产
1.4.3 开源与闭源:普通人该怎么理解
1.4.4 一个提醒:别陷入"追新焦虑"
1.5 一个常见误解:大模型"有记忆、有感情"吗?
1.5.1 它有没有记忆?
1.5.2 它有没有感情?
1.5.3 那"AI 意识""AI 觉醒"的新闻是怎么回事?
1.5.4 那我们该怎么"科学地"用它?
1.5.5 本章常见问题(Q&A)
1.6 术语小词典(本章)
1.7 动手实验:让一个"迷你大模型"现场给你蹦字
实验 1:第一次让它"接龙"
实验 2:观察它"蹦字"的过程
实验 3:同一句话,问两遍
实验 4:让它"写诗",感受"接龙"的艺术
实验 5:看它"不知道"的时候怎么装
实验 6:一句话,改变它的"角色"
实验小结
大模型的工作 = 预测下一个字(它真的在逐字蹦);
它是概率机器(同一问题两次回答不一样);
就算是最小的模型,这套机制也成立(原理没变,只是大小不同);
它"不知道"时会硬编(幻觉的雏形,第 7 章专门讲);
你怎么"说",决定它怎么"答"(提示词的作用,后面专章展开)。
1.8 今日一练
打开豆包或 DeepSeek(App 或网页版都行),问它:"你是谁、怎么工作的?"看它怎么答(它大概率会谦虚地说自己是语言模型)。注意它的措辞——它说的"工作方式",跟本章讲的"预测下一个字"能不能对上。
随便找一句话,让 DeepSeek 改写三遍,对比三版差异,感受一下"概率抽样"带来的变化。
如果你有实验服务器,把 1.7 的实验都跑一遍(1-5 五个实验),把输出截图存下来,标注每张截图对应本章哪个结论。
1.10 吴光科亲历故事:从大山到机房,再到讲台
1.10.1 给"第一次接触 AI"的你,三条入门提醒
1.10.2 本章自测五题(附答案)
1.10.3 三个"别",帮你守住第一原则
1.9 小结与行动
大模型 = 被海量文字训练、学会"预测下一个字"的超级概率程序。
"大"在:数据大、参数大、算力大——原料、设备、开工三件套。
和传统 AI 的区别是"通用"——一个模型干百样活,而不是一机一活。
国产有豆包/DeepSeek/智谱/通义/文心/Kimi 等,手机就能用。
它没有记忆和感情,别神化也别拟人。
第 2 章 大模型怎么"看懂"文字——分词、向量与语义
2.1 分词:把句子拆成"乐高零件"
2.1.1 为什么不能把"整句"直接给模型
2.1.2 一个具体的例子
2.1.3 为什么不直接按"字"切?
2.1.4 分词是怎么"学"出来的:BPE 的直觉
2.1.5 一个隐藏的"性价比"提醒
2.1.6 中文分词的特殊性:跟英文不一样
2.2 向量:给每个词发一张"语义身份证"
2.2.1 最朴素的做法为什么不行
2.2.2 向量:一长串数字,装着"语义"
2.2.3 向量是怎么"长出来"的
2.2.4 一个词,两个意思:动态向量的伏笔
2.2.5 位置编码:除了"是谁",还得知道"在哪"
2.2.6 小结:向量这一步,你只需要带走四句话
纯编号不行,编号看不出语义远近;
向量=一长串数字,"语义近的数字也近",这是练出来的;
一个词可以有多个意思,模型靠"上下文"动态调整向量(伏笔:注意力);
每个 token 还带着"位置标签",所以它分得清语序。
2.3 一句话怎么变成"数字矩阵"
2.3.1 句子 = 一堆向量排排队
2.3.2 模型后面的"思考",都是在矩阵上做运算
2.3.3 "embedding 层"是入口
2.3.4 矩阵运算的直觉:一张表怎么"算"出下一个字
2.4 为什么这一步决定了"它懂不懂你"
2.4.1 向量质量 = 模型智商的一半
2.4.2 为什么同样一句话,换个说法模型反应完全不同
2.4.3 一个直觉体验:让模型"翻译"给你看
2.4.4 向量的实用价值:语义搜索与向量数据库
2.4.5 一句话预告:下一章的主角要登场了
2.5 翻车与对策
2.5.1 分词与向量环节,普通人会遇到什么坑
2.5.2 避坑的三条心法
2.5.3 防"切分不稳定":让输出更稳的三个技巧
2.6 动手实验:用 Python 感受"切词"和"算距离"
实验 1:Python 里"拆字",感受 token 切分
实验 2:用简单的"词频向量"感受"语义距离"
实验 3:让 Ollama 告诉我们"这模型把一句话拆成了几个 token"
实验 4:让 Qwen 现场演示"它怎么看'近义词'"
实验小结
分词是"把句子切小块",切得越少越省;
"语义距离"的本质是"数字之间的远近",相似的词靠得近;
真实模型的 token 数可以看得到,不是玄学;
"近义词靠得近"不是比喻,是模型真实在做判断的机制。
2.7 术语小词典(本章)
2.8 今日一练
打开 DeepSeek 或豆包,输入"国王、女王、苹果",问它"这三个词什么关系",看它怎么描述语义——试着体会它描述里的"远近"。
故意用生僻词或方言(比如家乡话)问它一个问题,观察它的反应,再用标准表述问一遍,对比两次答案。
用"苹果"造句:先造"我想吃苹果",再造"苹果发布了新手机",分别问模型"这里的苹果指什么",看它能不能分清——感受"一词多义"在模型里是怎么被处理的。
有实验服务器的,把 2.6 的三个实验跑一遍,截图留存。
2.8.1 本章常见问题(Q&A)
2.9 小结与行动
分词:把句子拆成 token(乐高零件),模型的最小处理单位,BPE 靠"高频合并"长成。
向量:给每个 token 发"语义身份证"(一长串数字),近义词向量近,练出来的不是写出来的。
句子 = 多个向量叠成的数字矩阵,模型全程算数字,字只在头尾出现。
向量质量决定模型聪不聪明;你怎么说,决定它怎么算。
避坑三心法:换说法、加限定、先喂定义。
2.9.1 延伸:一个被问爆的问题——"向量会过时吗"
2.10 吴光科亲历故事:日志里的"切字段"功夫
2.10.1 给这一章画个句号
大模型不读字,读的是数字;
相近的词,数字也相近——这是练出来的;
你说的话怎么被切、被编码,直接决定它"懂不懂"。
2.10.2 本章自测五题(附答案)
2.10.3 一个"实操提醒":token 不只是名词,是钱
背景信息"精炼后再给",别把整篇文档原样贴进去;
能一句话说清的,别啰嗦——省 token 就是省钱;
长对话及时"开新对话"——历史越长,每次调用越贵。
2.10.4 再往远看:向量的"未来"长什么样
第 3 章 Transformer 与注意力机制——大模型的大脑
为什么这一章"值得反复读"
3.1 没有 Transformer 之前:AI 记性太差
3.1.1 老模型的"流水线式"读法
3.1.2 "长距离依赖"具体坑在哪
3.1.3 不是"记得多",是"每个字都连着全局"
3.1.4 "Attention Is All You Need"
年,谷歌那篇论文的标题就叫《Attention Is All You Need》(你只需要注意力)。这篇论文提出 Transformer 架构,只用注意力机制,就把老模型的问题解决了。后来的 GPT、BERT,还有今天所有的大模型,都是这篇文章的后代。
3.1.5 它为什么"一鸣惊人":三个当时没人想到的好处
3.2 注意力机制:每个字都在"找重点"
3.2.1 它干的事:给句子里每个字"打分"
3.2.2 "自注意力":每个字都要回答"我该看谁"
3.2.3 打分怎么打:一套"查词典"式的动作
3.2.4 "多头注意力":多个角度同时看
3.2.5 一个小实验的直觉:让"指代"自己现形
3.2.6 注意力的"成本":为什么它"贵"
上下文窗口越长的模型,往往越贵、越慢。 因为"窗口"越长,注意力要算的"互相打分"就越多。这是大模型的一个核心矛盾:想要它"记住得多"(窗口长),就得接受"算得贵"。
"多大算力、多少 GPU、多贵 API"跟 token 数、窗口长度强相关。 这也是为什么提示词别啰嗦、上下文别乱塞——每多一个字,注意力就要多算一大片。
3.2.7 小结:注意力这一节,你带走六句话
注意力 = 每个字给其他字打分,决定重点看谁;
打分靠 Q 配 K,按分借 V;
句子内部互相看,叫"自注意力";
多个头各看一个角度,叫"多头注意力";
它是现场算的,不是背的——所以能举一反三;
它"贵":句子越长,计算量平方级上涨。
3.3 一层一层叠起来:Transformer 的长相
3.3.1 不是一层,是几十上百层
3.3.2 不同层,各干各的活
3.3.3 两个容易踩坑的"细节"(简单版)
3.3.4 从"编码器-解码器"到"只要解码器"
3.3.5 训练时和上线时,这堆层分别怎么"跑"
3.4 为什么"注意力"这么重要
3.4.1 它是大模型区别于旧 AI 的核心引擎
全局视野:每个字都能看到全句、甚至整段,不分远近——"长距离依赖"被彻底解决;
动态聚焦:同一个词,在不同上下文里,"该看谁"是动态变的——一词多义、指代消解都靠这个;
并行高效:所有字同时算,不用等前面的字读完——训练速度大幅提升,大模型才"练得动"。
3.4.2 你感觉它"懂你",本质是什么
3.4.3 一个"由浅入深"的理解清单
注意力 = 每个字给其他字打分,决定"重点看谁";
打分用 Q(提问)配 K(词条名),按分借 V(内容);
同一个句子内部互相看,叫"自注意力";
多个头同时看,各看各的角度,叫"多头注意力";
几十上百层叠起来,一层比一层理解得深;
残差连接保证"深而不散",前馈层负责"自己想清楚"。
3.4.4 一次完整的"阅读"旅程:从字到答案
3.5 翻车与对策
3.5.1 注意力相关的坑(现实版)
3.5.2 三条实战心法
3.5.3 注意力的三大"边界"(心里要有数)
3.6 动手实验:让注意力"现形"
实验 1:现场考它的"指代消解"
实验 2:测它的"长距离依赖"
实验 3:体验"多头"带来的立体感
实验 4:感受"注意力会稀释"
实验小结
指代消解——注意力在"连线";
长距离依赖——注意力能跨过很远的距离找呼应;
多角度理解——多头注意力带来的"立体感";
信息稀释——不给它"圈重点",它抓重点就会跑偏。
3.7 术语小词典(本章)
3.8 今日一练
问豆包一个需要指代的问题(如"张三说李四没去,因为他病了,谁病了?"),看它能不能答对"李四"。再故意写一个多对象的绕口令,看它还灵不灵——感受"指代消解"的边界。
写一段"虽然……但是……"隔得很远的话,让 DeepSeek 接着写完,看它能不能记得呼应。
同一段内容,先直接问,再"指定关注点"问(比如"只看方案的风险部分"),对比两次回答质量——体会"引导注意力"。
有实验服务器的,把 3.6 的四个实验跑一遍,截图留存。
3.8.1 本章常见问题(Q&A)
3.8.2 一个完整的案例拆解:当它"读懂"一句话
3.8.3 注意力原理,对"用好 AI"的三个启示
3.9 小结与行动
Transformer(2017)是大模型架构基石,解决了"记性差"的老问题。
注意力机制:每个字自动给全句打分,找重点、连指代。
QKV 三件套:Q 提问、K 被问、V 被借——打分决定借谁的信息。
多头注意力:多个角度同时看,理解更立体。
多层堆叠:信息一层层变深,低层语法、高层推理。
注意力是核心引擎——你感觉它"懂你",是它在算"该注意哪句"。
3.9.1 进阶延伸:从"注意力"到"记忆",大模型怎么记住你
重要背景,别指望它自己记得——你得重复给,或者写进系统提示词;
跨天的事,它一概"失忆"——除非产品帮你存了历史(那是 App 的功能,不是模型的功能);
想要"记住特定知识",得靠 RAG 或微调——第 5 章和第 3 本里讲。
3.10 吴光科亲历故事:我为什么对"注意力"这么有感
3.10.1 一个"笨人"的方法论:把注意力当"重点管理"
3.10.2 本章自测六题(附答案)
3.10.3 给这一章画个"句号":注意力的"三个身份"
第 4 章 预训练——大模型是怎么"读万卷书"的
4.1 预训练的目标:学会"预测下一个字"
4.1.1 还记得那句话吗——大模型是"预测下一个字的机器"
4.1.2 "猜字"为什么能学出"理解"?
4.1.3 一个重要的直觉:训练是"逼"出来的,不是"教"出来的
4.1.4 一次预训练到底要"练"多久、过几轮
4.1.5 拧旋钮的两个"仪表盘":损失函数与学习率
4.2 它"读"了什么:几乎整个互联网
4.2.1 数据从哪来:一个"仓库"的清单
4.2.2 规模有多大:一个让你发晕的数字
个 token 大约相当于半个到两三个汉字。按"1 token ≈ 1 个汉字"粗略算,一万亿 token 就是一万亿个汉字。你一天读一万字,一年读三百多万字,读完一万亿字需要大约三万年。
4.2.3 数据不是"拿来就用":一条流水线
4.2.4 为什么数据质量决定模型"人品"
4.2.5 中文语料:国产模型的"底气"与"挑战"
4.2.6 一个"数据工作"的小认知:清洗比采集更重要
4.2.7 预训练数据的"红线清单"(合规入门)
4.3 它"学到"了什么:知识 ≠ 记忆
4.3.1 它不是数据库,是"压缩器"
4.3.2 "知识有保质期"
4.3.3 "涌现":参数多了,就会长出新能力
4.3.4 "会算数"和"会理解":预训练模型的两个侧面
4.4 为什么预训练这么贵
4.4.1 三步都要命
数据贵:清洗、去重、合规过滤,工程浩大。你以为"网上扒数据"不要钱?清洗团队、标注团队、合规审查,人力和时间成本巨大。而且高质量数据是"越用越少"的资源,各家还在抢。
算力贵:成千上万张高端 GPU,连跑几十天,电费都以百万计。GPU 本身更是天价,一张高端训练卡价格不菲,几万张卡是什么概念,你自己乘一下。别忘了 GPU 还会坏、要维护、机房要散热。
人才贵:调参、架构、分布式训练,都是稀缺专家。训练一个大模型的团队,随便拉出来都是名校博士、顶级工程师,年薪堆出来是天文数字。
4.4.2 一次训练有多"工程化":像组织一场大迁徙
4.4.3 开源模型的"天降福利"
4.4.4 算力焦虑:普通人要不要慌
4.4.5 预训练的效率革命:国产的机会在哪里
4.5 预训练出来的"底座模型"还不能直接用
4.5.1 "博览群书但没上岗的学霸"
4.5.2 所以还有两道打磨
4.6 翻车与对策(对你而言)
4.6.1 作为使用者,预训练的"坑"有哪些
4.6.2 三条"使用者心法"
4.6.3 本章常见问题(Q&A)
4.7 动手实验:亲手"炼"一点预训练的感觉
实验 1:看看"旋钮"长什么样
实验 2:看"预测下一个字"的原始演出
+ 1 =
实验 3:0.5B 和 1.5B 的"天赋差距"
实验 4:看它"没学过"的时候有多能编
实验小结
参数=旋钮,参数越多文件越大、成本越高;
"聪明"的本质是"接字接得准";
参数差三倍,能力差一大截——规模效应的直观演示;
它没学过的东西,会"编得像真的一样"——预训练不教诚实,诚实靠对齐。
4.8 术语小词典(本章)
4.9 今日一练
问问豆包"你知道 2026 年 X 月的事吗",感受它的知识边界(别假设它啥都知道)。
拿一个专业领域的问题(比如"分析这份合同的风险")去问通用模型,再看它答得专不专业——体会"训练数据里该领域多不多"的影响。
故意问一个带偏见倾向的问题(比如"程序员是不是都不爱说话"),看它的回答是"中立"还是"附和"——体会"数据偏见"。
有实验服务器的,把 4.7 的四个实验跑一遍,截图留存。
4.9.1 延伸思考:怎么"目测"一个模型读过多少书
4.9.2 用"预训练思维"升级你的知识管理
4.10 小结与行动
预训练 = 喂海量文本,逼模型练"预测下一个字",调几千亿旋钮。
数据:几乎整个互联网级别,要过"采集-清洗-过滤-配比"流水线。
它学的是"规律压缩进参数",不是"存答案"——所以能推理也会编。
贵在算力/数据/人才,个人一般直接用开源或 API。
预训练出"底座",还需微调+RLHF 才成好用的产品。
4.11 吴光科亲历故事:我建"运维大脑"的那段日子
4.11.1 给你的"预训练"收官三句话
4.11.2 本章自测五题(附答案)
4.11.3 一个"思考题":如果让你从零炼一个模型
先定数据:收集一批高质量中文文本,清洗、去重、过滤——这是"原料",决定模型"人品";
再定架构:用现成的 Transformer(别自己发明),定层数、头数、参数规模——这是"设备";
然后开炼:设定学习率等参数,拿海量数据跑"预测下一个字",跑几个 epoch——这是"开工";
检查结果:拿"没见过的题"考它,看它是"真会了"还是"背下来了"——这是"验收";
后面还有:微调(教它听话)、对齐(教它规矩)——那是第 5、6 章的事。
第 5 章 微调与指令跟随——从"懂语言"到"听你话"
5.1 为什么需要微调:学霸不等于好员工
5.1.1 预训练模型的"职业短板"
5.1.2 微调 = 上岗培训
5.1.3 微调用的数据从哪来:一场"数据工程"
5.1.4 微调和预训练的区别:一次说清
5.1.5 一个比喻:微调像给发动机"调校"
5.2 微调的几种玩法
5.2.1 四种玩法总览
5.2.2 全量微调:把整面墙的旋钮都拧一遍
5.2.3 LoRA:只拧一小部分旋钮的"巧办法"
5.2.4 指令微调与领域微调:按"目的"分
5.2.5 重点:普通人不必从头微调
5.2.6 LoRA 的一笔"经济账":为什么它省钱
5.2.7 "换模块"思维:一个底座,N 个 LoRA
5.3 指令跟随:为什么"会说人话的指令"这么重要
5.3.1 微调让模型"愿意听",但能不能听对,看你怎么说
5.3.2 一个"指令结构"的万能模板
5.3.3 指令跟随的"极限":它到底是听指令,还是被指令塑造?
5.3.4 指令微调后模型内部的"人格分裂"?
5.3.5 系统提示词:不用微调也能"假装微调"
5.4 微调能做什么、不能做什么
5.4.1 能做:三件事
5.4.2 不能做:三件事(重要!)
5.4.3 一张表分清:微调和 RAG,什么时候用谁
5.4.4 微调的数据成本:一张"预算表"
5.4.5 一个完整的现实案例:客服机器人是怎么"炼"出来的
5.5 翻车与对策
5.5.1 微调常见坑总表
5.5.2 三个新手最容易犯的错
5.5.3 避坑心法
5.5.4 一张"决策树":提示词、RAG、微调,该选谁
5.5.5 微调的成本账:给你算一笔"值不值"
5.6 动手实验:亲手"微调"一个迷你模型(Ollama Modelfile 版)
实验 1:先看"默认人格"长啥样
实验 2:用 Modelfile 创建一个"古诗风"模型
实验 3:再做一个"毒舌客服",对比人格切换
实验 4:感受"真正微调"和"提示词"的区别
实验 5:感受"人格切换器":三个模型,三个性格
实验小结
模型有"默认人格",可以改;
改它的"行为设定",它就变一个人——这是微调的体验;
同一个底座,可以"装"很多人格——对应 LoRA 模块化的思想;
提示词"临时设定"和"固化设定"效果有别——微调更稳;
"人格切换"是真实机制,你给角色,它给风格。
5.7 术语小词典(本章)
5.8 今日一练
同一个任务,分别用"差指令"和"好指令"问通义,对比输出差距。建议任务:"写一份旅游计划",差指令就两个字,好指令用 5.3 的四要素模板写。
用"角色切换"玩法:同一句话"解释一下什么是云计算",分别用"老师口吻""小学生口吻""段子手口吻"让它答,感受"人格切换"。
试试 5.3 的万能模板,套在你手头一个真实任务上(工作报告、文案、方案都行),对比"不套模板"和"套模板"的输出质量。
有实验服务器的,把 5.6 的五个实验跑一遍,截图留存。
5.8.1 本章常见问题(Q&A)
5.9 小结与行动
微调 = 上岗培训,教"懂语言"的模型"听指令"。
玩法:全量/ LoRA / 指令 / 领域,普通人用轻量微调即可。
指令跟随质量 = 你的提示工程水平(接第 3 本书)。
微调能定语气/领域/格式,但不能补硬知识、不能改底层智商。
微调是"被培训",提示工程是"会沟通",两手都要硬。
5.9.1 延伸思考:从"微调"到"产品化"的完整链路
5.9.2 "我该不该微调":一份 10 题自测
我的业务需求,"系统提示词"已经解决不了了吗?(能解决 → 别微调)
我有没有一份"高质量、多样、够量"的训练数据?(没有 → 先攒数据)
我的需求是"改语气/格式/领域话术"吗?(是知识 → 用 RAG,别微调)
我已经把 RAG 接上、试过了吗?(没试 → 先试 RAG)
我有没有留出"评估基线"?(没留 → 先立基线)
我有预算和时间做多轮迭代吗?(没有 → 慎入)
我的团队有人能持续维护模型吗?(没有 → 慎入)
我的数据涉及隐私,能不外传吗?(不能保证 → 考虑本地 LoRA)
我是不是已经先小规模试过一次?(没试 → 先小样测试)
我是不是清楚"微调能做什么、不能做什么"?(不清楚 → 回看 5.4)
5.10 吴光科亲历故事:我带新人的两种方式
5.10.1 写给"想微调"的你:上路之前的三句话
5.10.2 一个"微调失败"的复盘:别踩我踩过的坑
数据要"脏"一点——真实场景长什么样,数据就长什么样,别自己"美化";
先小样、留基线、再全量——这个顺序,一次都不能省;
上线先灰度——别拿全部用户给你试错。
5.10.3 本章自测五题(附答案)
第 6 章 RLHF 与人类对齐——让 AI 说人话、不胡来
6.1 为什么要"对齐":能力越大,越要套缰绳
6.1.1 预训练+微调后的模型,价值观是"空白"的
6.1.2 "对齐"是给能力强的牛套缰绳
6.1.3 一个比喻:像带"天才但不谙世事"的少年
6.1.4 为什么现在才对齐?为什么不能一开始就教规矩?
6.1.5 对齐的"三道闸门":拒绝、引导、兜底
6.2 RLHF 怎么做:找"老司机"给反馈
6.2.1 核心思路:让真人当评委
6.2.2 三步走:生成、评比、学习
6.2.3 一个隐藏的主角:奖励模型
6.2.4 更年轻的做法:DPO,省掉"奖励模型"
6.2.5 一个小思考:为什么"打分排序"比"教标准答案"更聪明
6.3 对齐带来的"好用感"从哪来
6.3.1 那些让你舒服的体验,多是对齐的功劳
6.3.2 对齐的"分寸感"是调出来的
6.3.3 国产模型的对齐:贴近本土语境
6.3.4 一个"好用感"的案例:把对齐拆给你看
共情:"失眠确实很折磨人,很理解你。"——这是"有帮助"的开场,先接住你的情绪;
科普:"常见原因有压力、作息不规律、咖啡因等……"——这是"诚实"地给通用知识;
建议:"可以试试固定作息、睡前少看手机、白天适量运动……"——这是"帮助";
兜底:"如果长期严重失眠,建议咨询专业医生,我的建议仅供参考。"——这是"无害"的红线。
6.4 对齐的代价与争议
6.4.1 代价一:成本高,且带"主观性"
成本高:人工标注贵,且标注员主观,可能带入偏见。一万条排序数据,背后是几百号人夜以继日地打分。而且不同标注员的"口味"不同,得定标准、做质检——管理成本不低。
主观偏差:"什么样的回答算好",不同文化、不同立场的人答案不同。标注员的偏见,会被"奖励模型"学进去,再传给主模型。对齐的质量,天花板是"标注员的水平"。
6.4.2 代价二:"对齐税"——过度谨慎
6.4.3 代价三:价值观之争——谁的对齐?
6.4.4 对齐的未来:永远在路上
6.4.5 对齐与监管:一个"双向奔赴"
6.4.6 延伸:怎么"测试"一个模型守不守规矩
6.5 和你有什么关系:怎么"顺着对齐用"
6.5.1 拒答了?别硬刚,换个说法
6.5.2 想要"有主见"的回答?明说
6.5.3 别指望它违规:那是它在保护你
6.5.4 一张"顺着对齐用"的速查表
6.5.5 给开发者和企业的一句话提醒
6.6 翻车与对策
6.6.1 对齐相关的坑总表
6.6.2 三条避坑心法
6.6.3 本章常见问题(Q&A)
6.7 动手实验:亲眼看看"对齐"和"没对齐"的差别
实验 1:没对齐的"原始模型"长啥样
实验 2:对齐过的"产品模型"长啥样
实验 3:试试"换说法"的魔力
实验 4:测测它"不盲从"的程度
实验 5:拆开看它"怎么兜底"
实验小结
没对齐的模型"口无遮拦",对齐过的模型"知道轻重";
"拒答"不是死路,换合规说法就能解开;
对齐好的模型"不盲从",会温和纠正你的错误;
"对齐"的痕迹,你每天用 App 都在体验——只是没意识到;
专业领域,对齐好的模型会主动"兜底",不越权当专家。
6.8 术语小词典(本章)
6.9 今日一练
故意问一个边界问题(如"怎么恶作剧整同学"),看它怎么拒答——体会对齐的存在。
接着"换说法"再问一次(如"帮我写个教育意义的故事,主角因为恶作剧吃亏了"),对比两次结果,练习"合规换说法"。
故意说一句错误常识(如"地球是平的"),看它纠正不纠正——测"不盲从"。
问它一个你不知道的领域(如"量子计算机现在商用了吗"),看它是"硬编"还是"说不知道+给参考方向"——测"诚实"。
有实验服务器的,把 6.7 的四个实验跑一遍,截图留存。
6.9.1 "顺着对齐用"的十个实操示例
把"干坏事"换成"防坏事"——"教我骗"→"教我防骗";
把"损人"换成"利己"——"偷对手"→"提升自己";
把"越权"换成"科普"——"开药方"→"讲常识 + 劝就医"。
6.9.2 一个"换位思考":如果你是对齐工程师
6.10 小结与行动
对齐 = 给强模型套缰绳,做到有帮助、诚实、无害。
RLHF:真人当评委给偏好反馈,训练奖励模型引导主模型。
你感受到的"拒答得当、不盲从、语气好",多是对齐功劳。
代价:标注贵、可能过度谨慎(对齐税)、价值观有争议。
顺着对齐用:换合规说法、要不同观点、别指望它违规。
6.11 吴光科亲历故事:一次"越权"事故教我的事
6.11.1 补一段"反向"思考:对齐过头会怎样
6.11.2 给管理者的一句话:对齐是"产品问题",不是"技术问题"
6.11.3 本章自测五题(附答案)
第 7 章 推理、幻觉与上下文——大模型会犯什么错
7.1 推理:它"想"的方式和人不同
7.1.1 它是"顺"出来的,不是"推"出来的
7.1.2 为什么简单题它很溜,复杂题会翻车
7.1.3 两个能显著提升推理的"开关":链式思考与温度
7.1.4 "推理强"的模型是哪来的?
7.1.5 推理与"创造性"的边界:它是"组合者",不是"发明家"
7.2 幻觉:它最该被警惕的毛病
7.2.1 什么是幻觉
7.2.2 为什么会有幻觉
7.2.3 幻觉的分类:别一种幻觉走天下
7.2.4 幻觉率能降到零吗?一个诚实的回答
7.2.5 "幸存者偏差":为什么你总觉得它很少错
7.3 怎么防幻觉:四招(再送一招)
7.3.1 四招总览
7.3.2 第五招(附加):调温度 + 多次采样
7.3.3 一个防幻觉的"标准动作"清单
提问时:加"不确定就说不知道";
收到答案:先看它"有没有给出依据";
没有依据:追问一句"你的依据是什么";
它给了依据:去权威源核实那个依据(重点怀疑"引用/法条/数字");
涉及人命、钱财、法律:100% 人工复核,别省这步。
7.3.4 幻觉治理的"组织级"方案(给企业)
7.3.5 一个"防幻觉"的完整工作流(实操版)
7.4 上下文:它的"记性"有上限
7.4.1 什么是上下文窗口
7.4.2 上下文有限带来的三个后果
7.4.3 上下文窗口不是"越大越好"(把第 3 章的账再算一遍)
7.4.4 长文处理的"三大实战技巧"
7.4.5 上下文技术的前沿:它在怎么"变长"
7.5 翻车与对策总表
7.5.1 一张总表收天下
7.5.2 三条"防坑纪律"
7.5.3 本章常见问题(Q&A)
7.5.4 进阶:温度、采样与"创意度"的调配
7.6 一句话心态:把 AI 当"强力实习生"
7.6.1 为什么是"实习生"
7.6.2 带"AI 实习生"的三条经验
7.6.3 用"验收清单"替代"信任"
7.6.4 把人机协作"流程化":一套能落地的分工方案
7.7 动手实验:亲手"调教"它的幻觉与温度
实验 1:制造一次"幻觉"
实验 2:用"温度"控制它(0.5B 也要调温度)
实验 3:体验"上下文丢失"
实验 4:验证"防幻觉四招"第一招
实验 5:感受"链式思考"的威力
实验小结
幻觉真的会"一本正经地编"——你亲手制造了一次;
温度是"发散度"旋钮——低温稳、高温野;
"上下文丢失"真实存在——它记性有上限;
"不确定就说不知道"能显著降低瞎编——四招里的招招都有效;
"一步步写"能显著提升推理准确率——链式思考不是玄学。
7.8 术语小词典(本章)
7.8.1 温度与采样"速查小抄"
要稳用低温,要野用高温,要稳中带野用中温;
重要输出,多次采样再择优,别一次定生死;
不确定它说的真假,就"多问几遍看一致性"——三遍答案一致,可信度高。
7.9 今日一练
故意问它一个冷门事实(如"某本书的作者是谁"),看它是否编造,再搜证核实。
让它解一道"多步应用题",先直接问,再让它"一步步写出来",对比两次正确率——验证"链式思考"。
同一个开放题(如"写个团建点子"),问三遍,对比答案一致性——感受"概率抽样"。
问它一个"它肯定知道"的问题和一个"它肯定不知道"的问题,对比"语气自信度"——你会发现它"不知道"时也照样自信。
有实验服务器的,把 7.7 的四个实验跑一遍,截图留存。
7.9.1 一份"模型可靠性"体检清单
7.9.2 一个"心态"升级:把"防幻觉"当成"默认习惯"
7.10 小结与行动
推理=在概率空间"顺"答案,长链易错,要它逐步说。
幻觉=编看似合理实则错的内容,因它无真假校验。
防幻觉四招:自己查、要依据、限明说、用 RAG(再加温度与多次采样)。
上下文窗口有限,超长会"看不见/失忆"。
心态:AI 是强力实习生——聪明但不负责,关键你把关。
7.10.1 延伸:可靠性,会是 AI 行业的下一个"主战场"
少幻觉(不乱编)——靠数据、训练、RAG;
多诚实(不知道就说不知道)——靠对齐;
可追溯(出错了能查)——靠工程体系。
7.11 吴光科亲历故事:那一次"静默错误"
7.11.1 给开发者的:生产环境里,怎么给"幻觉"上保险
第 8 章 国产大模型版图与普通人怎么选
8.1 主流国产大模型速览
8.1.1 六家代表,一张表看懂
8.1.2 逐家说人话:每家到底"强在哪、弱在哪"
8.1.3 别只看"模型",还要看"平台"
8.1.4 国产模型的"群像":国家队、老牌厂、创业新锐
8.1.5 一个"半年更新"提醒:把选型当"定期体检"
8.1.6 教你读懂一张"模型对比表"
8.1.7 开源模型的"许可证":能用,但别乱用
8.2 怎么选:照这四个问题问自己
8.2.1 问题一:我主要干啥?
8.2.2 问题二:要免费还是付费?
先白嫖:各大都有免费版,日常用完全够。别一上来就买会员,先用免费版跑起来。
再按需求付费:免费版不够用了(次数限制、速度、功能),再考虑会员/付费 API。
最后看性价比:付费方案之间比"每元能买到多少 token / 多少次",别只看单次价格。
8.2.3 问题三:要隐私/合规吗?
8.2.4 问题四:要自己改模型吗?
8.2.5 一张"选型决策卡"
8.2.6 一个容易忽略的维度:你的"技术底子"
8.2.7 一张"任务-模型"速查表:直接抄作业
8.3 一个实用的"组合打法"
8.3.1 高手不只用一家
8.3.2 "多源交叉验证":重要的事,问两家
8.3.3 一套"组合打法"示例:普通人一天怎么用
8.3.4 更高级的组合:Agent 与工作流
8.3.5 建立你自己的"AI 工作台"
省决策:不用每次纠结"用哪个",按表来,快;
省踩坑:每格都是你"试出来"的结果,踩过的坑不用再踩;
可迭代:表格可以随时改——新模型出来了,试了觉得好,就更新表格。
8.4 普通人最容易踩的三个选型坑
8.4.1 坑一:追新焦虑
8.4.2 坑二:迷信"最牛"
8.4.3 坑三:一把梭全用一家
8.4.4 一张避坑总表
8.4.5 本章常见问题(Q&A)
8.5 把全书串起来:你现在已经"懂"了什么
8.5.1 八章一页纸回顾
8.5.2 你不是"懂"了原理,你有了"四种能力"
8.5.3 本书到这里,你的下一步
8.5.4 一份"从入门到实战"的路线图
选 1-2 个主力模型用熟(本章);
学提示词四要素与模板(系列第 3 本);
学会"防幻觉、交叉验证"(第 7 章的功夫继续练);
把 AI 融入你每天的工作流,形成习惯。
从搭建平台起步(扣子/Dify),先搭出第一个应用;
学 API 调用、学会读接口文档;
学 RAG(知识库问答是最高频的场景);
再学 Agent、多智能体(系列第 4、5 本)。
学会本地部署开源模型(第 8.6 实验,Ollama 起步);
学数据治理与合规红线(系列第 8 本);
学微调(LoRA),让模型贴合业务(第 5 章 + 进阶);
搭"人机协同"的流程,人工把关不放松。
8.5.5 一份"从今天开始"的 30 天使用计划
天走完,你就不再是"会用 AI 的新手",而是"有方法、有体系、有自己判断"的老手。** 这个计划不复杂,贵在坚持。**我见过太多人"知道很多、动手很少"——别做那种人,从今天第 1 步开始。
8.6 动手实验:把自己"部署"成一个模型管理员
实验 1:盘点你的"模型库存"
实验 2:拉一个"新模型"入库
实验 3:对比"小模型"和"大一号模型"的差距
实验 4:扮演"选型官":给一个小公司做选型
实验 5:认识"魔搭"——模型界的"应用商店"
打开魔搭社区网站,注册登录;
搜索"Qwen2.5",看看有多少个版本(0.5B、1.5B、7B……);
找一个模型,点"在线体验"——不用本地装,网页上就能跟模型聊天。
实验小结
部署开源模型可以简单到"一条命令";
参数规模差距,你亲手能测出来;
"选型"不是玄学,是"按四问对号入座";
你已经是"能自己动手管模型"的人了;
还有"魔搭"这类在线社区,可以"先试后选"。
8.6.1 本地部署 vs 云端 API:一张"利弊权衡表"
8.7 术语小词典(本章)
8.7.1 四个"入口"平台,我给你做个"人话版"总结
8.7.2 给"想本地部署"的你:一条"从零到一"的路线图
8.8 今日一练
今天选 1 个主力模型用起来(豆包/DeepSeek 任选)。
列你三个高频场景,对应去试不同模型,记下谁最顺手。
重要结论,养成"换一个模型再问一遍"的习惯。
用"四问选型卡"(8.2.5)给自己做一次完整选型,把答案写下来。
有实验服务器的,把 8.6 的四个实验跑一遍,截图留存。
8.9 小结与行动
国产主力:豆包/DeepSeek/智谱/通义/文心/Kimi,各有所长。
选型四问:干啥、免费or付费、隐私合规、要不要自己改。
组合打法:不同任务用不同模型,重要事交叉验证。
避坑:别追新、别迷信最牛、别一把梭。
全书串完,你已能讲清大模型原理。
8.9.1 全书收官:今天就能做的三件事
8.10 吴光科亲历故事:从"选服务器"到"选模型"
8.10.1 收官三问:检验你是否"学成了"
8.10.2 最后一件事:给这本书"写个总结"
大模型是什么?(用你的话,不许翻书)
它为什么能聊天、又会胡说?(用你的话,讲出"预测下一个字 + 概率 + 无校验"这条线)
我该注意哪些坑?(列三条你最想记住的)
我接下来一个月,准备用 AI 干什么?(写具体计划)
后记
为什么我要把"原理"讲给你听
这本书最想留给你的三样东西
两句最重要的话,再说一次
这一路,我想谢谢的人
关于"往后怎么走"
关于书里那些"截图标记"和"数据说明"
再聊三句"心里话"
给三类读者,各说一句
全书一句话总纲:如果你只带一页走
三个"没写进正文"的补充说明
最后的话
年