> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment.md).

# 第八章：从预训练到对齐：让模型有用且安全

预训练产出的“基础模型”拥有丰富的语言知识，但它**不知道如何与人类有效交互**——它会无差别地续写任何文本，包括有害内容。从一个能写诗也能写恶意代码的“原始大脑”，变成一个有用、诚实且安全的助手，需要经历**后训练对齐**（Post-training Alignment）的过程。

本章介绍后训练的三个核心阶段——监督微调（SFT）、基于人类反馈的强化学习（RLHF）、直接偏好优化（DPO）——以及参数高效微调技术，再回过头看这些做法各自会在哪里坏掉，最后拆开评测本身这条流水线，沿着六个问题展开：

* [8.1 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.1_sft.md)：只会顺着文本续写的基础模型，怎么学会“被问就答”？
* [8.2 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.2_rlhf.md)：开放性问题没有标准答案，好坏该由谁来判定？
* [8.3 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.3_dpo.md)：四个模型同时常驻显存的流程，能删到只剩几个？
* [8.4 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.4_peft.md)：训练目标不变，哪些参数才真的值得更新？
* [8.5 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.5_practice.md)：训练损失一路向下，为什么模型可能已经坏了？
* [8.6 节](/llm_internals/di-er-bu-fen-xun-lian-pian/08_alignment/8.6_evaluation.md)：用来判断好坏的那个准确率，本身是怎么算出来的？

实践入口：[A.6](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/appendix/a6_practice_path.md)用小张量核对标签掩码、LoRA、DPO 与组内优势；[A.7](/llm_internals/di-si-bu-fen-mo-xing-yu-qian-yan-pian/appendix/a7_framework_recipes.md)将这些机制接到 Transformers、PEFT 和 TRL，要求同时检查训练行为与保留集质量。
