> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization.md).

# 第十章：推理优化：第一性原理的分析

训练好的模型需要在用户请求时快速生成响应。在生产环境中，推理延迟和吞吐量直接影响用户体验和运营成本。本章从推理瓶颈的第一性原理分析出发，系统介绍 KV 缓存、FlashAttention、量化、剪枝、蒸馏和投机解码等核心优化技术。

本章依次回答五个问题：

* 推理的瓶颈到底在算力还是在访存？为什么 Prefill 和 Decode 的答案不一样？（[10.1 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.1_bottleneck.md)）
* KV 缓存凭什么值得占掉那么大一份显存和带宽？（[10.2 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.2_kv_cache.md)）
* K 和 V 压小之后，算一次注意力为什么还是慢？（[10.3 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.3_flash_attention.md)）
* 把模型压小有两条路：压每个数的位宽，还是直接减少参数的数量？（[10.4 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.4_quantization.md)、[10.5 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.5_pruning_distillation.md)）
* 一个权重都不改，能让每次前向多产出几个词元吗？（[10.6 节](/llm_internals/di-san-bu-fen-tui-li-yu-bu-shu-pian/10_inference_optimization/10.6_speculative_decoding.md)）
