第九章 AgentOps 与生产化落地
写好提示词只是第一步。将智能体发布到生产环境面临着并发、延迟、成本、错误处理等工程挑战。本章探讨如何构建健壮、可观测、可扩展的智能体系统。核心路径:架构设计模式 → 鲁棒性与可观测性 → 成本与性能优化 → 企业安全治理 → 故障恢复与上线清单。
学习目标
完成本章后,你将能够:
选择 合适的架构模式(ReAct/编排-执行/反思)
实现 全链路可观测性与监控调试
优化 成本控制与延迟性能
部署 企业级安全与合规治理
诊断 故障与实现韧性设计
章节地图
本章按“先搭骨架 → 再看得见 → 再算得起 → 再守得住 → 最后回到该不该建”的顺序展开:
9.1讲从工作流到智能体的设计模式谱系9.2讲 Harness 架构:模型之外的执行与治理层9.3讲可观测性与调试,把黑盒执行变成可追踪的链路9.4讲性能优化与成本控制9.5讲企业级平台的架构、安全与治理9.6讲典型故障模式与韧性设计9.7讲架构陷阱与反模式9.8讲从实验到生产的决策路线图与检查清单9.9用实证数据讲自主度该怎么量、怎么监控9.10收尾于一个前置问题:这件事到底该不该用智能体做
下一节: 9.1 设计模式:从 Workflow 到 Agent
新增:本章新增了 9.2 Harness 架构,介绍从 Prompt Engineering → Context Engineering → Harness Engineering 的工程范式演进,以及生产级 Agent Harness 的四大核心子系统。
最后更新于
