大模型预训练是什么?
预训练(pre-training)是训练大模型时的第一阶段:让模型先在海量数据上“学会语言与通用模式”。常见做法是自监督学习(模型不需要人工标注“答案正确与否”,而是从文本本身造一个学习任务)。
最典型的目标是 Next-Token Prediction(预测下一个token):
- 给模型一段文本,比如:
今天天气很好,因为... - 训练时把后面的词拿走,让模型去预测“接下来最可能出现的词是什么”
- 通过大量样本反复训练,模型逐渐学会语法、常识、表达方式,甚至一定程度的知识组织与推理能力
这阶段学到的不是“某个具体知识点的数据库”,而是大量文本中统计规律的综合:语言怎么用、概念怎么关联、常见事实如何被描述等。
常见架构上,主流大模型用 Transformer,预训练时往往再加一些优化(比如混合精度、并行训练、合适的学习率/批大小等)。
为什么那么耗时耗钱?
大模型预训练之所以贵,主要是因为它同时满足了“规模大 + 训练轮次多 + 计算和通信压力大”。
1) 参数规模巨大,需要大量计算
以“更大模型”为目标时:
- 参数数量从千万/亿到数百亿甚至千亿级
- 训练每一步都要做大量矩阵计算(尤其是注意力机制带来的计算开销)
- 为了学得更好,需要很多步(或很多“token”)
粗略理解:参数多 → 计算更重;数据越多 → 训练步数越多。
2) 需要海量训练数据:token 数量巨大
模型不是按“句子数量”学,而是按**token(更细的文字片段)**学。
- 训练数据往往是 TB 级甚至更大
- 训练可能消耗上万亿 token
- 这意味着训练不是“跑几小时/几天”,而是持续很长时间
3) 训练通常要跑很多轮/很多次实验
为了达到目标性能,通常不是“一次预训练就结束”,而是:
- 多次尝试不同超参数(学习率、批大小、序列长度等)
- 不同数据混合比例
- 可能还要进行多阶段预训练(例如不同领域数据的进一步训练)
所以总成本往往是“多次迭代的总和”。
4) 分布式训练导致通信开销也很大
大模型放不进单机内存,必须用多机多卡:
- 张量并行、流水并行、数据并行等方式把训练拆开
- 但模型训练需要频繁同步梯度/激活等中间量
- 通信网络(带宽、延迟)会成为瓶颈
因此训练不仅“算力贵”,还要求昂贵且高性能的集群环境。
5) 能耗与散热、运维成本高
长时间跑大规模训练会带来:
- 电力成本
- 机房散热(空调/液冷等)
- 运维人员与设备折旧
这些会显著抬高总成本。
你可以用一句话概括
预训练就是用海量文本把模型训练成“会语言、会模式、也会一定程度的知识组织”的通用能力;它之所以耗时耗钱,是因为要在超大参数、超大量token、超复杂分布式计算条件下跑很长时间。