确定了预训练目标和架构之后,如何让训练过程真正有效地收敛到良好的解,是一个充满技术细节的工程挑战。损失函数的选择、优化器的设计、学习率的调度和正则化策略——这些看起来“只是超参数调整”的工作,实际上包含着深刻的数学原理和丰富的工程经验。
本章将解析这些训练技术的底层逻辑,沿着四个问题展开:
6.1 节:Adam 为什么是默认优化器,这个“默认”近来又为什么被动摇?
6.2 节:Adam 已自适应各参数步长,全局学习率为什么还要先预热再衰减?
6.3 节:学习率调得再准,异常放大的梯度照样能毁掉训练,怎么按住它?
6.4 节:有效批次大小该定到多大,上界由什么决定?
最后更新于 18小时前