2451 字
约 8 分钟
0
大模型基础原理:AI 吃什么长大?从训练数据到 PreTraining 为什么改变一切

开场:AI 不是凭空聪明,它得"吃东西"长大

很多人第一次接触大模型时会困惑:AI 怎么会说人话?它懂语法、懂常识、甚至能写代码,难道是被人一行行"教会"的?

答案是:AI 是吃数据长大的。它的全部能力,都来自被喂进去的海量文本;它每一次回答,都是把"吃过的知识"按概率重新吐出来。这篇文章就用 5 个问题,把大模型最基础也最关键的原理一次讲清。

一、AI 的食物是什么:训练数据与参数量

训练数据:AI 的"饭"

大模型吃的"饭"是文本数据——书、网页、论文、代码、新闻、对话记录,统统塞进去。这些数据被切成小块喂给模型,模型从中"看"出语言的规律。

把数据量换算成人类能感知的单位:

  • 一本书大约有 10 万 Token(Token 是 AI 读文字的最小单位,后面细讲)。
  • 一个藏书百万册的大型图书馆,大约有 1000 亿 Token。
  • 而 GPT-3 的训练数据约有 3000 亿 Token——相当于 300 万个图书馆的藏书量(按一本 10 万 Token 算,约 300 万本书)。
  • 到了 Llama 3(405B 参数),训练数据更是高达 15 万亿 Token,是 GPT-3 的 50 倍。

所以"AI 读过的书比人一辈子读的多几百万倍",不是夸张,是保守说法。

参数量:AI 的"脑容量"

参数是模型内部要学习的"旋钮",每一个参数都是一个需要从数据里学出来的数值。参数越多,模型能记住的规律越复杂,但也越能吃数据、越贵。

模型 参数量 训练 Token 量
GPT-2 15 亿 400 亿
GPT-3 1750 亿 3000 亿
Llama 2 70B 700 亿 2 万亿
Llama 3 405B 4050 亿 15 万亿
GPT-4(非公开) 传闻约 1.8 万亿(MoE) 传闻 13 万亿+

学界有个著名的 Chinchilla 法则(缩放定律):在算力最优的情况下,参数量与训练 Token 量应大致保持 1 参数 ≈ 20 Token 的比例。GPT-3 用 1750 亿参数只喂了 3000 亿 Token,其实"没吃饱";Llama 3 则大量"加餐",所以同样规模下表现更好。数据量和参数要匹配,缺一不可。

二、训练 vs 推理:备课与答题

同一个大模型,有两种完全不同的工作状态,很多人混为一谈。

维度 训练(Training) 推理(Inference)
目的 让模型"学会" 让模型"使用"
计算方式 前向 + 反向传播,更新权重 只做前向计算,权重不变
数据 海量无标注文本 用户的一句话
成本 极高,一次几百万到上亿 较低,但每次调用都要花
时间 数周~数月 毫秒~秒级
类比 备课 / 考试复习 上考场答题
  • 训练:把 15 万亿 Token 反复"读"几十遍,靠反向传播一点点调整参数,让"预测下一个词"越来越准。成本主要在开发阶段,是模型公司烧钱的大头。
  • 推理:参数已经固定,模型拿到你的问题,只做一次"预测下一个词"的运算。成本在每次使用时产生,所以按 Token 计费。

一句话:训练决定了模型"会不会",推理决定了模型"答得有多快、多贵"。

三、词表与训练内容:AI 是怎么"读"文字的

词表(Vocabulary):AI 的"字母表"

模型不认识"文字",只认识数字。它先通过分词器(Tokenizer)把文本切成一串 Token,再映射成数字喂进去。

  • Token 是什么:中文里,一个汉字约等于 0.5~1 个 Token;英文里,一个常见单词约 1~2 个 Token。"我爱 Clarity 学习台"可能被切成 6~8 个 Token。
  • 词表多大:主流大模型的词表在 5 万~20 万个 Token 之间。生僻字、新词会被拆成更小的字节片段(BPE 算法),所以没有"看不懂"的词,只有"拆得更碎"的词。
  • 为什么重要:词表设计直接影响模型对中文/英文/代码的切分效率,也直接影响计费——API 按 Token 收费,中文用户往往觉得"一个字也要算钱",就是因为中文信息密度高、Token 消耗大。

训练内容:AI 到底学了什么

训练数据里包含的大致是:

  • 通用世界知识:百科、新闻、书籍 —— 让它懂常识。
  • 语言能力:语法、表达、逻辑 —— 让它会说话。
  • 代码:GitHub 等开源代码 —— 让它会写程序。
  • 对话:论坛、问答 —— 让它会接话。
  • 数学与推理:题目与解题过程 —— 让它"会算"。

注意:它学的不是"标准答案",而是**"在这个位置,下一个词最可能是什么"**的统计规律。所谓"懂",本质是"概率掌握得足够好"。

四、Base 模型:一台 Token 推 Token 的机器

去掉所有花哨包装,大模型(GPT 系)的本质是一台**"Token 推 Token"的机器**:

输入一段 Token 序列 → 模型逐字预测下一个最可能的 Token → 把新 Token 接到序列后面 → 再预测下一个……直到结束。

它没有"想法",没有"计划",只有一件事:根据已经看到的文字,猜下一个字。

  • 训练时:给模型看"今天天气真",让它学会把"好"的概率调高,然后拿上亿条这种任务反复迭代。
  • 推理时:你问"今天天气怎么样",它其实是把"今天天气怎么样?"作为开头,然后一个词一个词地"接"出答案。

这就是为什么 ChatGPT 的回答有时会"一本正经地胡说八道"——它不是在"想",而是在"顺着概率接话"。理解这台"Token 推 Token"的机器,就理解了 AI 的一切优点和缺点。

五、PreTraining 为什么改变了一切:从 CNN/RNN/BERT 到 GPT

大模型史上有过一个决定性转折,叫 预训练(PreTraining)。理解它,就理解了大模型为什么能"赢"。

前 AI 大模型时代:CNN / RNN

  • CNN(卷积网络):擅长图像,靠"卷积核"扫描局部特征,需要大量人工标注的数据。
  • RNN(循环网络):处理序列(文本/语音),一个词一个词地"排队"处理,难以并行,训练慢、记忆短。

共同痛点:都要人工标注、任务特定——想让它做情感分析,就得标几万条"正面/负面";换个任务,又得重新标注重新训练。数据成本高到离谱,模型也谈不上通用。

BERT:会"填空"但不爱"说话"

BERT 是预训练思路的重要里程碑,但它走的是**编码器 + 掩码语言建模(MLM)**路线:

  • 把句子挖掉几个词(如"我__北京"),让模型填空("爱")。
  • 它**"理解"能力强**(编码器双向看上下文),但不擅长生成——本质是个"阅读理解器",要用于具体任务还得再做微调。
  • 所以 BERT 是"半成品":预训练降低了一些成本,但生成能力缺失,通用性有限。

GPT:把"接龙"做成终极武器

GPT 做了三个看似简单、实则颠覆的改动:

  1. 用解码器,单向自回归:只按顺序一个词接一个词预测(next-token prediction)。
  2. 不需要人工标注:文本本身自带"标准答案"(下一个词),所以可以无监督地把整个互联网的数据都拿来学——这就是 PreTraining 的威力。
  3. 规模拉到极致:当参数量和训练数据足够大,"预测下一个词"这个简单任务,竟自动涌现出翻译、总结、写代码、逻辑推理等能力,完全不需要人教。

为什么说它"改变一切"

对比项 前大模型时代(CNN/RNN/BERT) GPT 时代
数据来源 人工标注,贵且少 互联网海量文本,免费且无限
任务范式 每个任务单独训练 一个模型通吃所有任务
是否生成 多不能/不擅长 天生会生成
能力来源 人教出来的 规模化中"涌现"出来的
关键一步 特征工程/模型设计 PreTraining + Scaling

PreTraining 的意义在于:把"数据"这个要素的权重无限放大——只要数据够多、参数够大、算力够强,语言能力就会自己"长"出来。这一发现,直接开启了 GPT、Claude、Gemini 的时代。

结语:5 句话带走整篇

  1. AI 的食物是数据,GPT-3 吃了相当于几百万本书的文本,参数量 1750 亿。
  2. 训练是备课,推理是答题,一个烧钱一次,一个持续计费。
  3. Token 是 AI 的最小文字单位,中文信息密度高,所以更"烧 Token"。
  4. 大模型本质是"Token 推 Token"的接龙机器,一切能力源于"猜下一个词"。
  5. PreTraining 让模型从"人教的"变成"数据里长出来的",这就是大模型改变一切的起点。
大模型基础原理:AI 吃什么长大?从训练数据到 PreTraining 为什么改变一切
https://www.clxhxhhr.top/posts/4606/
作者
clxstart
发布于
2026-10-10
许可协议
CC BY-NC-SA 4.0
评论
0 条
还没有评论,先写一条吧。