> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding.md).

# 第九章：解码策略：模型如何生成文本

训练好的语言模型拥有了对文本的深层理解和生成能力，但**如何从模型输出的概率分布中选取词元来构建完整的文本**，是一个独立且重要的技术问题。不同的解码策略直接影响生成文本的质量、多样性和一致性。

本章将从自回归解码的基本机制出发，逐步讨论贪心搜索、束搜索和各种采样策略的设计逻辑与适用场景，并探讨推理时计算扩展这一新兴范式——如何通过在推理阶段投入更多计算来提升模型的深度推理能力。本章最后跳出自回归的框架，介绍**扩散语言模型**这条不同的生成路线，用它照出「生成必须串行」这个一直被默认成立的前提。

沿着这条线索，本章依次回答六个问题：

* 文本是一个词元接一个词元生成出来的，这个循环每一步重算什么、又复用什么？（[9.1 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding/9.1_autoregressive_decode.md)）
* 每步都选概率最高的那个词元，为什么不等于整句最优？（[9.2 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding/9.2_greedy_beam.md)）
* 把随机性放回来之后，多样性与质量之间的阈值该怎么定？（[9.3 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding/9.3_sampling.md)）
* 采样只看概率，凭什么保证输出是一个合法的 JSON？（[9.4 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding/9.4_constrained.md)）
* 在解码阶段多投入计算，能换来更强的推理吗？（[9.5 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding/9.5_test_time_scaling.md)）
* 「从左到右、一次一个词元」这个前提，本身是必须的吗？（[9.6 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/09_decoding/9.6_diffusion_lm.md)）
