> For the complete documentation index, see [llms.txt](https://yeasy.gitbook.io/agentic_ai_guide/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://yeasy.gitbook.io/agentic_ai_guide/di-er-bu-fen-qun-ti-zhi-neng-yu-jin-hua/07_evolution.md).

# 第七章 学习、评估与进化

如果智能体每天犯同样的错误，那它不是真正的智能。本章探讨智能体的动态进化能力。不同于 LLM 预训练的一次性，智能体的学习应该是终身的、持续的。通过强化学习(RLHF/RLAIF) → 多维评估体系 → 持续进化机制（经验回放、自我修正、数据飞轮）的完整路径，实现行动→评估→反思→学习的闭环。

## 学习目标

完成本章后，你将能够：

1. **应用** RLHF/RLAIF 进行智能体行为微调
2. **建立** 多维度的评估体系与基准测试
3. **实现** 轨迹分析与持续学习机制
4. **优化** 推理能力与对齐安全性

## 章节地图

本章按“怎么学 → 怎么量 → 怎么看清 → 怎么持续 → 怎么想得更深”的顺序展开：

* `7.1` 讲 RLHF / RLAIF 如何把反馈信号变成行为改变
* `7.2` 讲评估体系与基准测试，以及基准本身也会失真这件事
* `7.3` 讲轨迹分析与行为可解释性，让失败可归因
* `7.4` 讲持续学习与知识更新，把单次经验沉淀成长期能力
* `7.5` 讲推理能力与测试时计算，从快速响应走向深度思考

***

**下一节**: [7.1 从反馈中学习：RLHF 与 RLAIF](/agentic_ai_guide/di-er-bu-fen-qun-ti-zhi-neng-yu-jin-hua/07_evolution/7.1_rl.md)
