> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-er-bu-fen-xun-lian-pian/06_training_techniques.md).

# 第六章：训练技术的底层逻辑

确定了预训练目标和架构之后，如何让训练过程真正有效地收敛到良好的解，是一个充满技术细节的工程挑战。损失函数的选择、优化器的设计、学习率的调度和正则化策略——这些看起来“只是超参数调整”的工作，实际上包含着深刻的数学原理和丰富的工程经验。

本章将解析这些训练技术的底层逻辑，沿着四个问题展开：

* [6.1 节](/llm_internals/di-er-bu-fen-xun-lian-pian/06_training_techniques/6.1_loss_optimizer.md)：Adam 为什么是默认优化器，这个“默认”近来又为什么被动摇？
* [6.2 节](/llm_internals/di-er-bu-fen-xun-lian-pian/06_training_techniques/6.2_lr_schedule.md)：Adam 已自适应各参数步长，全局学习率为什么还要先预热再衰减？
* [6.3 节](/llm_internals/di-er-bu-fen-xun-lian-pian/06_training_techniques/6.3_regularization.md)：学习率调得再准，异常放大的梯度照样能毁掉训练，怎么按住它？
* [6.4 节](/llm_internals/di-er-bu-fen-xun-lian-pian/06_training_techniques/6.4_batch_sequence.md)：有效批次大小该定到多大，上界由什么决定？
