NEWS / BLOG DETAIL

大模型预训练是什么?为什么那么耗时耗钱?

大模型预训练是什么?

预训练(pre-training)是训练大模型时的第一阶段:让模型先在海量数据上“学会语言与通用模式”。常见做法是自监督学习(模型不需要人工标注“答案正确与否”,而是从文本本身造一个学习任务)。

最典型的目标是 Next-Token Prediction(预测下一个token)

  • 给模型一段文本,比如:今天天气很好,因为...
  • 训练时把后面的词拿走,让模型去预测“接下来最可能出现的词是什么”
  • 通过大量样本反复训练,模型逐渐学会语法、常识、表达方式,甚至一定程度的知识组织与推理能力

这阶段学到的不是“某个具体知识点的数据库”,而是大量文本中统计规律的综合:语言怎么用、概念怎么关联、常见事实如何被描述等。

常见架构上,主流大模型用 Transformer,预训练时往往再加一些优化(比如混合精度、并行训练、合适的学习率/批大小等)。


为什么那么耗时耗钱?

大模型预训练之所以贵,主要是因为它同时满足了“规模大 + 训练轮次多 + 计算和通信压力大”。

1) 参数规模巨大,需要大量计算

以“更大模型”为目标时:

  • 参数数量从千万/亿到数百亿甚至千亿级
  • 训练每一步都要做大量矩阵计算(尤其是注意力机制带来的计算开销)
  • 为了学得更好,需要很多步(或很多“token”)

粗略理解:参数多 → 计算更重;数据越多 → 训练步数越多

2) 需要海量训练数据:token 数量巨大

模型不是按“句子数量”学,而是按**token(更细的文字片段)**学。

  • 训练数据往往是 TB 级甚至更大
  • 训练可能消耗上万亿 token
  • 这意味着训练不是“跑几小时/几天”,而是持续很长时间

3) 训练通常要跑很多轮/很多次实验

为了达到目标性能,通常不是“一次预训练就结束”,而是:

  • 多次尝试不同超参数(学习率、批大小、序列长度等)
  • 不同数据混合比例
  • 可能还要进行多阶段预训练(例如不同领域数据的进一步训练)
    所以总成本往往是“多次迭代的总和”。

4) 分布式训练导致通信开销也很大

大模型放不进单机内存,必须用多机多卡:

  • 张量并行、流水并行、数据并行等方式把训练拆开
  • 但模型训练需要频繁同步梯度/激活等中间量
  • 通信网络(带宽、延迟)会成为瓶颈
    因此训练不仅“算力贵”,还要求昂贵且高性能的集群环境。

5) 能耗与散热、运维成本高

长时间跑大规模训练会带来:

  • 电力成本
  • 机房散热(空调/液冷等)
  • 运维人员与设备折旧
    这些会显著抬高总成本。

你可以用一句话概括

预训练就是用海量文本把模型训练成“会语言、会模式、也会一定程度的知识组织”的通用能力;它之所以耗时耗钱,是因为要在超大参数、超大量token、超复杂分布式计算条件下跑很长时间。