> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training.md).

# 第七章：大规模分布式训练

当模型参数从数百万扩展到数千亿，单张 GPU 的显存和计算能力远远不够。大规模分布式训练是将 Transformer 从论文中的小模型变为拥有数千亿参数的大语言模型的关键工程技术。

本章系统介绍分布式训练的核心策略——数据并行、ZeRO 优化、张量并行、流水线并行、激活重计算、混合精度训练以及检查点管理与容错——解释每种技术解决的具体问题和背后的设计逻辑，沿着七个问题展开：

* [7.1 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.1_data_parallel.md)：梯度在多卡上取平均，凭什么等价于大批次训练？
* [7.2 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.2_zero.md)：模型状态在每张卡上复制一份，冗余怎么拆掉？
* [7.3 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.3_model_tensor_parallel.md)：把单层权重切到多卡，一层最少要几次通信？
* [7.4 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.4_pipeline_hybrid.md)：改成按层切分，流水线空转的气泡怎么摊薄？
* [7.5 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.5_activation_checkpointing.md)：激活值还是装不下，能不能不存、用时再算？
* [7.6 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.6_mixed_precision.md)：位宽减半就能提速，梯度下溢怎么办？
* [7.7 节](/llm_internals/di-er-bu-fen-xun-lian-pian/07_distributed_training/7.7_checkpoint.md)：重启时卡数变了，落盘的状态还拼得回来吗？
