引言:同一家公司的 AI,价差却像两个世界
你在对话框里让 AI 写一篇 800 字小作文,可能只花几分钱;让它生成一张 1024×1024 的图片,却要几毛到几块;再让它生成一段 5 秒的视频,价格直接跳到十几块甚至更高。
同样是"AI 干活",为什么价差这么大?答案不在"模型更聪明",而在算力消耗——AI 产品的定价,本质是 GPU 烧电烧得有多快。这篇扫盲文,我们一层层拆开看。
一、先搞清楚:聊天为什么"便宜"
聊天大模型(LLM)的工作方式,本质是逐字接龙:每生成一个字(Token),都要把前面所有内容再"读"一遍,预测下一个字。
- 按 Token 计费:一次普通对话,回复可能只有几百到一两千 Token,算力消耗可控。
- 缓存红利:系统提示词、历史对话可以被缓存复用(KV Cache),后续生成大幅变便宜。
- 单次计算量小:生成一个 Token,只做一次"预测下一个字"的前向计算,和整幅图像相比,量级差很多。
所以聊天是按"字数"计费,一次几厘到几分钱很正常。
二、生图为什么贵:一场"从噪声中雕琢画面"的重活
聊天是写文字,生图是"画整幅画"。当前主流生图模型(如 Stable Diffusion、Midjourney、Flux)基于扩散模型(Diffusion Model),原理和写文字完全不同:
- 从纯噪声出发:模型先随机生成一张全是噪点的图。
- 逐步去噪:每去噪一次,都要把整张潜空间图完整过一遍神经网络,让画面清晰一点点。
- 反复迭代:通常要重复 20~50 步,才能得到能看的成品。
这带来了三个量级上的碾压:
| 维度 | 聊天(LLM) | 生图(扩散模型) |
|---|---|---|
| 生成单位 | 一个字(Token) | 整幅图像 |
| 每步计算 | 预测一个 Token | 全图过一遍网络 |
| 迭代次数 | 1 次 | 20~50 次去噪 |
| 计费方式 | 按 Token | 按张数 |
粗略估算,生成一张 1024×1024 的图,计算量相当于几千甚至上万 Token 的文本生成,贵几十到上百倍完全合理。
还有两个隐藏成本:
- 分辨率是平方增长:1024×1024 的像素数是 512×512 的 4 倍,计算量跟着翻倍往上走。
- 缓存几乎失效:聊天可以缓存重复内容,但每张图都是全新的像素组合,生成过程难以复用。
三、视频为什么按秒收费:一秒 = 24 张图的连拍
视频比图片贵一个数量级,原因一句话就能说清:视频 = 逐帧生图 + 帧间一致性。
- 一秒 24~30 帧:生成 1 秒视频,相当于连续生成 24~30 张图。
- 每帧都走完整去噪流程:没有捷径,每一帧都要从噪声"雕"出来。
- 时序建模额外烧钱:光有 30 张独立的图还不够,还要保证画面里的人物、光影、动作是连续合理的,这需要专门的时序(Temporal)模块跨帧建模,又是一笔不菲的算力。
所以按"秒"收费并不是拍脑袋,而是因为秒就是计费的自然单位——一秒视频的算力成本 ≈ 二三十张图的成本之和,再乘上时序建模的系数。平台按秒报价,只是把背后的算力账换算成了用户好理解的单位。
四、算力账单:钱到底花在了哪
把上面三部分合成一张总账:
| 任务 | 大致算力消耗(相对) | 用户感知的计价单位 |
|---|---|---|
| 一次聊天回复 | 1 | Token / 次 |
| 一张 1024² 图片 | 数十 ~ 上百 | 张 |
| 1 秒 AI 视频 | 数百 ~ 上千 | 秒 |
这些数字背后是真实的硬件账单:一张 H100/A100 显卡时租价、数据中心电费、模型推理的峰值算力占用。生图和视频动辄让 GPU 满载跑几十秒甚至几分钟,聊天一眨眼就结束,成本自然差着数量级。
五、以后会越来越便宜吗?
会,而且已经在发生:
- 蒸馏与少步数推理:SDXL-Turbo、LCM 等把去噪步数从 30~50 压到 1~4 步,速度提升一个数量级,价格随之下降。
- 缓存与复用:相同场景、相同底图的生成可以缓存复用。
- 专用芯片与推理优化:针对扩散模型的算子优化、更高效的视频生成架构(如 DiT)都在持续拉低成本。
- 规模化效应:用户越多、算力越便宜,单次生成的边际成本越低。
现在"贵"的背后,是技术还在快速进步阶段的真实成本;等生成效率再上一个台阶,价格自然会跟着下来。
结语:价格是算力的一面镜子
回到开头的问题——AI 生图比聊天贵、视频按秒收费,不是因为平台"故意坑你",而是因为每一次生成背后,都是真实 GPU 在高速运转、真金白银的电费在燃烧。
下次你看到一张惊艳的 AI 图片、一段丝滑的 AI 视频时,可以想一下:那一秒背后,是几十帧画面从噪声中一点点"雕"出来的重活。理解这一点,你就能看懂 AI 产品的定价逻辑,也更能理解"算力为王"这四个字的分量。