"Token""上下文""参数""RAG""多模态""Agent"……打开任何一篇 AI 文章,这些词就像天书一样砸过来。其实它们都不难——每一个都能用一句话加一个比喻说清。这篇就是你的 AI 名词扫盲贴,看完再看到这些词,你不会再犯怵。
一、Token:AI 怎么"读"文字
AI 不读字,读 Token。Token 是模型处理文本的最小单位,可以理解成"半个字/一个词/一个标点"。
- 中文里,一个 Token 大致等于一个字到几个字;
- 英文里,一个 Token 大致等于一个词或半个词。
你可以把它想成:模型把一句话切成小块(Token),再一小块一小块地"吃"进去理解。所以"多少 Token"就是"多长文本"——API 按 Token 计费,就是按它吃了多少块算钱。
二、上下文:为什么聊久了 AI 会"忘记"事情
你刚跟 AI 说的每句话,都放在它的"临时便签"里,这个便签就叫上下文(Context)。它没有长期记忆——它只记得这张便签上写的东西,聊完就丢。
- 聊得越久,便签越长;
- 便签有上限,这个上限叫上下文窗口;
- 一旦超出上限,最早的内容就被挤掉——于是它"忘了"你开头说的需求。
所以"聊久了会忘记事情"不是它笨,是它的便签就这么大。想让它记住,要么把关键信息重新说一遍,要么把旧对话翻到新窗口里。
三、推理模型(深度思考):先在草稿纸上演算再交答案
普通模型像"口算",你问它就直接报答案;推理模型(也常叫"深度思考/深度推理")像"打草稿",会先在内部一步步推理、验证,再誊写出最终答案。
- 普通模型:看到问题 → 直接给结果;
- 推理模型:看到问题 → 内部推理演算(相当于在草稿纸上写步骤)→ 交答案。
代价是它更慢、更费算力;好处是遇到复杂问题(数学、逻辑、多步任务)明显更稳。日常闲聊用普通模型,难题再用推理模型,别让杀鸡刀去砍柴。
四、参数:旋钮越多越聪明吗
参数(Parameters)是模型里可调"旋钮"的数量,是容量指标——旋钮越多,能装下的"见识"越多,理论上能记住的模式越丰富。但"多"不等于"聪明":
- 数据质量 + 训练方法同样关键:旋钮多,拧得不好也白搭。喂进去一堆垃圾,旋钮再多也是记了一堆错经验。
- 吨位要配任务:日常活儿(写文案、改稿、问答),小模型常常更划算——便宜、快、够用;只有复杂任务才值得上大模型。
- 参数竞赛听听就好:新闻里"XX 模型 1 万亿参数"当热闹看就行。干得好不好,才是你真正该关心的。
五、多模态:为什么有的 AI 看不懂图片
"模态"就是信息的种类:文字、图片、音频、视频各是一种模态。只懂文字的模型叫单模态,你发张图给它,它只能看见一堆二进制,当然"看不懂"。
多模态模型能同时处理多种模态:图片识别、语音、视频理解。原理上,它多了个"翻译官"(视觉/音频编码器),把图片切块变成模型能读的 Token,再喂给大脑理解。
- 单模态:只会看字;
- 多模态:字、图、音、视频都能读。
所以"为什么有的 AI 看不懂图片"——因为它只装了"字"这一只眼睛。
六、微调 vs RAG:让 AI 变懂行的两条路
想让 AI 更懂你的领域,有两条主流路:微调(Fine-tuning)和 RAG(检索增强生成)。
- 微调:拿一批你的数据,继续训练模型,把知识/风格"焊"进它自己的脑子里。之后它凭本事回答,不需要外部资料。像"给员工做长期培训,改造他本人"。
- RAG:不动模型本身,而是在回答前先从资料库里检索相关内容,把资料"喂"给模型当参考,再让它作答。像"开卷考试,带资料进场现查"。
一句话:微调改脑子,RAG 查资料。微调贵、周期长、改一次要重训;RAG 灵活、成本低、换资料库就行,所以日常私有知识问答基本首选 RAG。
七、LLM、知识库(Wiki) 和 RAG 的关系
- LLM(大语言模型):那个会接话茬的"大脑"——只会生成文字,不记得你的私有资料。
- 知识库/Wiki:你的私有资料仓库——文档、FAQ、内部规范都放这儿,但它是"死"的,自己不会说话。
- RAG:把两者接起来的"搬运工"——你提问时,它先从知识库里检索相关内容,再连同问题一起交给 LLM,LLM 基于这些资料作答。
关系就一句话:LLM 是脑子,知识库是书,RAG 是"查书再答题"的动作。所以 LLM 不等于知识库,RAG 也不是模型,它是让两者协作的机制。
八、名词对照表
- AI(人工智能):让机器模拟人类智能的总称,一切相关概念的"老大哥"。
- NLP(自然语言处理):让计算机理解、生成人类语言的技术,LLM 是它的最新形态。
- LLM(大语言模型):海量文本训练出来的"文字接话茬"模型,如 GPT、文心一言。
- GPT:OpenAI 推出的一类 LLM(Generative Pre-trained Transformer),名字是"生成式预训练 Transformer"的缩写。
- AIGC(AI 生成内容):用 AI 生成文字、图片、视频、音乐等内容,是"AI 用来干活"的统称。
- Agent(智能体):不仅能对话,还能自己规划、调用工具(查资料、跑代码)完成任务的多步 AI。
- 多模态:能同时处理文字/图片/音频/视频多种输入的模型。
- AGI(通用人工智能):像人一样什么都能干的 AI——目前还没实现,属于"远方目标"。
一句话总结
Token 是它读的"词块",上下文是它的"临时便签",推理模型"先打草稿再交卷",参数是"旋钮数"不等于聪明,微调是"改脑子"、RAG 是"查资料",多模态是"多长了只眼睛"。名词再多,拆开都是一句话的事。