附录 E:工程师配套实验代码
本目录是 B 轨的可复现实验包。五个实验都使用固定输入、仅使用 CPU、无需在线 API 或密钥;Python 3.11+ 标准库即可运行。每个文件公开两个稳定入口:run_experiment() 返回可序列化结果,evaluate(result) 返回包含 passed 与逐项 checks 的验收报告。
B 轨学习契约
前置条件
达到 A 轨验收标准或具备同等基础
Python 3.11+
会在命令行运行 Python 文件
一台可进行 CPU 计算的电脑
可交付物
五份实验结果字典与自评记录
一份失败案例与排障记录
一份最小 AI 工作流设计
验收标准
能复现实验的固定输入与预期范围
能解释每项评估为何通过或失败
能在不使用在线 API 和密钥的情况下完成五个实验
能把评估结果映射回对应章节的核心概念
五个实验映射
01_ml_basics.py
第 4 章
线性回归指标报告
evaluate() 返回 passed=True
02_structured_output.py
第 12.2 节
三个结构化输出校验结果
evaluate() 返回 passed=True
03_dl_overfitting.py
第 5 章
训练/验证损失与早停点
evaluate() 返回 passed=True
04_rag_minimal.py
第 12.5 节
检索命中、上下文与回答
evaluate() 返回 passed=True
05_agent_evals.py
第 14 章
两个案例的智能体评估报告
evaluate() 返回 passed=True
固定输入、预期范围与排障
01 线性回归
随机种子 42;100 条合成房价;80/20 拆分
斜率 4.5–5.5;RMSE 20–70;R² > 0.9
若结果变化,确认未改种子、样本数或拆分顺序
02 结构化输出
一个合法对象、一个多字段对象、一个破损 JSON
依次为 true / false / false
若多字段对象通过,检查是否仍拒绝额外字段
03 过拟合
随机种子 42;12 个带噪样本;4000 轮高容量拟合
最佳轮次 < 4000;最终验证损失高于最佳值
若没有反弹,检查噪声、学习率和验证集是否被改动
04 最小 RAG
固定本地语料与问题“RAG 和上下文工程有什么关系?”
首条命中含 RAG;上下文与回答均引用命中证据
若无命中,检查分词规则与语料是否仍包含 RAG
05 智能体评估
两个固定问题、答案和上下文
2 个案例;平均相关性 ≥ 0.8;一致性和忠实度均通过
若分数下降,检查输出是否引入上下文外内容
运行方式
在仓库根目录执行任一实验:
一次运行全部自动验收:
若脚本无法启动,先运行 python3 --version,确认版本为 3.11 或更高;再确认命令是在仓库根目录执行。实验不读取账号、网络或模型服务配置,因此不要把密钥写入代码或排障记录。
自评量表
每个实验按下列自评量表记 0–3 分,并附上一句证据:
0 分:脚本未运行,且没有可复现的错误记录。
1 分:能运行,但
evaluate()未通过,已保存失败结果和排障假设。2 分:
evaluate()通过,能复述输入、指标和预期范围。3 分:在保持固定基线的前提下改变一个变量,能解释结果变化并恢复基线。
五个实验至少都达到 2 分,才算完成 B 轨实验验收。3 分探索必须另存记录,不得改写固定基线或放宽自动阈值。
最后更新于
