大模型原理 · 你现在能做什么 别停在「我懂了」,先把那件事定下来 原理讲完,最容易发生的事是:你觉得学到了很多,但合上电脑,手上什么都没多。 所以从这里开始,每章结尾都有这么一页,只回答一个问题: 学完这章,你今天能动手做什么 。 一句话速览 需求收敛四段演示;三档任务:写四行需求、用五个真实输入试它、划一条人机分界线
全课有一条实战主线: 做出一个真能干活的 Agent 。六个里程碑各推进一格,你现在在第一格。
M0 想清楚它替你干什么 M1 能稳定说人话 M2 能动手干活 M3 改好改坏能量化 M4 长跑不失忆 M5 过程可复现
先看清楚 · 需求要收敛到什么程度才算数
大多数人给 AI 布置任务,停在第一段就交卷了:「帮我处理一下周报」。这句话没错,只是它 没法验收 。你不知道什么样的输出算成功,自然也不知道该不该改提示词。往下推三段,它才变成一个真需求。
从一句愿望到一个能验收的需求
再放一次
输入是什么、输出长什么样,你自己都没想清楚 。后面两段根本没机会跑。「试了一下感觉不行」,原因通常就在这儿。">停在一句愿望 关键是第三段 :写下「什么算对」,你才有资格判断某次改动是变好了还是变坏了。">收敛到能验收
01 一句愿望 「帮我处理一下周报」,想法有了,但也只是想法
02 定输入输出 进:一周的零碎记录;出:三段结论加一份下周计划
03 定什么算对 三段都能直接发给老板,一个字不用改
04 挑压幻觉的方案 要引具体数字,那就走 RAG,别让它凭记忆编
卡在第二段,这个需求还没法验收 停在「帮我处理一下周报」,第二段就卡住: 输入是什么、输出长什么样,你自己都没想清楚 。后面两段根本没机会跑。「试了一下感觉不行」,原因通常就在这儿。
第四段为什么要单拎出来 这一章你学了四种压幻觉的办法:改提示词、RAG、调 Temperature、加评测。选哪个, 看你的活儿会在哪儿出错 。这不是四选一的偏好题。要引具体数字和条款,走 RAG;格式老是飘,改提示词再把 Temperature 调低;要长期跑、怕它悄悄变差,那就得有评测。选错了不要紧,但 一开始就不选,等于把幻觉留给用户去发现 。
调不了 Temperature,不代表少了一条路。 它是 API 上的参数,ChatGPT、豆包这类对话产品里压根没这个开关。四种办法本来就彼此独立,缺这一个,另外三个照样单独成立。想把格式钉死,就在提示词里给一份模板加一个完整例子,写明「只输出这几个字段,不要解释」;同一句话连跑三遍看它稳不稳,比拧参数更能暴露问题。真到了非精确控制不可的程度,那本身就是该走 API 的信号。
动手清单 · 挑一个开始,勾掉它
这一章的动手清单 0 / 3 已完成
把那件事写成四行 15 分钟 所有人
照着上面四段,写下你最想交给 AI 的那件事:一句愿望、输入是什么、输出长什么样、什么算对。写在便签、备忘录、随便哪儿都行,但必须是 写下来的字 ,不能只是脑子里的想法。
什么算做完了 把这四行念给一个不了解你工作的人听,他能复述出「AI 要交出什么」。做不到,说明第二、三段还太虚。
用 5 个真实输入试它一遍 1 小时 想先验证可行性
别用编的例子。翻出五份真实材料丢给它,一次一份,提示词保持一模一样。 重点是看它在哪一类输入上开始胡说 ,答得好不好先放一边。材料太长?信息缺失?有内部专有名词?把出错的那一类记下来。
什么算做完了 你能说出一句具体的话:「输入里一旦出现某某,它就开始编。」笼统的「有时候不太准」不算。
划一条人机分界线 半天 准备真做一个
把这件事拆成「AI 做」和「你做」两半,写清 交接点长什么样 。比如:AI 出初稿并标出所有它不确定的数字,你只核对被标出来的那几处。分界线划在哪儿不重要,重要的是 它必须能被检查 。
什么算做完了 你能回答:如果 AI 那一半出错了,你在哪一步、用什么方式会发现?答不上来,说明这条线划得太靠后了。
写完了就存进建造日志 建造日志会一路陪你到协作方法论篇。六个里程碑填满,你手上就是一份完整的 Agent 设计说明。内容存在你自己的浏览器里,随时能导出成 Markdown。
去填 M0