For the complete documentation index, see llms.txt. This page is also available as Markdown.

第十章:推理优化:第一性原理的分析

训练好的模型需要在用户请求时快速生成响应。在生产环境中,推理延迟和吞吐量直接影响用户体验和运营成本。本章从推理瓶颈的第一性原理分析出发,系统介绍 KV 缓存、FlashAttention、量化、剪枝、蒸馏和投机解码等核心优化技术。

本章依次回答五个问题:

  • 推理的瓶颈到底在算力还是在访存?为什么 Prefill 和 Decode 的答案不一样?(10.1 节

  • KV 缓存凭什么值得占掉那么大一份显存和带宽?(10.2 节

  • K 和 V 压小之后,算一次注意力为什么还是慢?(10.3 节

  • 把模型压小有两条路:压每个数的位宽,还是直接减少参数的数量?(10.4 节10.5 节

  • 一个权重都不改,能让每次前向多产出几个词元吗?(10.6 节

最后更新于