> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/llm_internals/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction.md).

# 第一章：从序列建模到 Transformer

先读 [1.0 技术全景](/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction/1.0_technology_map.md)，定位 GPU、集群、训练框架、推理引擎与 Agent 的关系，再进入本章的模型原理。全景图附有各层核心技术的正文入口，可在后续阅读时随时回查。

自然语言是变长的符号序列，词与词的顺序本身承载意义。让机器处理这种输入，要同时解决三件事：吃下任意长度的输入、在任意距离上建立依赖、并且算得起。本章先把这三条做成一把尺子，再拿 RNN、CNN、注意力与 Transformer 逐个称量。

Transformer 的每一处设计都对应前一代方案的某条具体不足，因此本章按时间顺序走，沿着五个问题展开：

* [1.1 节](/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction/1.1_seq_challenge.md)：序列建模究竟在算什么？用什么口径判断一个序列模型的好坏？
* [1.2 节](/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction/1.2_rnn_cnn_limits.md)：RNN 与 CNN 在这三条轴上各差在哪？“梯度消失”与“感受野有限”能落成多大的数？
* [1.3 节](/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction/1.3_attention_birth.md)：注意力把长距离依赖的路径压到 1，代价是什么？解码一步内部的动作按什么顺序发生？
* [1.4 节](/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction/1.4_transformer_idea.md)：循环结构被整个拿掉之后，“完全并行”在什么范围内成立？
* [1.5 节](/llm_internals/di-yi-bu-fen-ji-chu-pian/01_introduction/1.5_milestones.md)：从 6500 万参数的翻译模型长到今天这套系统，每一次转折解决了什么、又留下什么新代价？

本章只建立判据与脉络，自注意力本身怎么算留给[第二章](/llm_internals/di-yi-bu-fen-ji-chu-pian/02_attention.md)。
