For the complete documentation index, see llms.txt. This page is also available as Markdown.

第八章:从预训练到对齐:让模型有用且安全

预训练产出的“基础模型”拥有丰富的语言知识,但它不知道如何与人类有效交互——它会无差别地续写任何文本,包括有害内容。从一个能写诗也能写恶意代码的“原始大脑”,变成一个有用、诚实且安全的助手,需要经历后训练对齐(Post-training Alignment)的过程。

本章介绍后训练的三个核心阶段——监督微调(SFT)、基于人类反馈的强化学习(RLHF)、直接偏好优化(DPO)——以及参数高效微调技术,最后回过头看这些做法各自会在哪里坏掉,沿着五个问题展开:

  • 8.1 节:只会顺着文本续写的基础模型,怎么学会“被问就答”?

  • 8.2 节:开放性问题没有标准答案,好坏该由谁来判定?

  • 8.3 节:四个模型同时常驻显存的流程,能删到只剩几个?

  • 8.4 节:训练目标不变,哪些参数才真的值得更新?

  • 8.5 节:训练损失一路向下,为什么模型可能已经坏了?

最后更新于