580 字
约 1 分钟
1
汇总(上)· 大模型是什么 + 幻觉
无标签

篇章汇总 汇总(上)· 大模型是什么 + 幻觉 大模型原理 · 总结回顾 · 上半页:大模型基础:它是什么,为何会幻觉。 一句话速览 训练本质 / Token / Base→SFT→Chat / 四种幻觉类型与根因

一 · 大模型是什么

🧠 大模型是什么 三个必须掌握的底层认知

训练本质 LLM = 超大型概率预测机器 训练 = 在 海量文本 上反复预测下一个 Token,参数记住的是 统计规律 ,不是理解。推理时参数冻结,只做条件概率计算。 P( 下一个 Token | 所有已知 Token )

Token & 上下文窗口 Token ≠ 字 · Context Window 是「桌面」 中文每字约 1 Token,常用词更省,生僻字会多占几个;英文每词约 1 Token。 Context Window 决定模型能看到多少。超出就截断,永久消失。 当前主流窗口:Qwen 3.6(1M)、Kimi K2.5(200K)、Claude 4.6(200K)、GPT-5.4(128K)

演进路径 Base → SFT → Chat 三阶段 Base Model(续写文字)→ SFT 指令微调(学会对话格式)→ Chat API(模拟多轮对话)。 你每次调用 API,本质是在 构造一个精心设计的 Message List ,让模型续写出你想要的内容。 [system] + [user/assistant …] + [user_now]

二 · 幻觉:LLM 的先天局限

👻 幻觉:LLM 的先天局限 不可消除,只能缓解

事实性幻觉 捏造不存在的事实、数据、引用

来源幻觉 引用了不存在的论文/链接/作者

推理幻觉 前提正确但推理步骤出错

代码幻觉 调用不存在的 API / 函数

根因一 参数知识有误 训练数据里本来就有错误信息;知识截止日期后的内容一无所知。

根因二 上下文理解偏差 Prompt 不清晰,模型只能猜意图;上下文矛盾时总是选最可能的续写,最可能不等于最准确。

关键认知

→ 幻觉 不可完全消除 ,因为它是概率预测的必然产物 → PreTraining 后参数 冻结 ,无法自动更新知识,这是幻觉的根本原因 → 正确做法:用工程手段 缓解 ,不要指望模型更聪明后幻觉自己消失

汇总(上)· 大模型是什么 + 幻觉
http://www.clxhxhhr.top/posts/3884/
作者
clxstart
发布于
2026-09-25
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。