V6|评测运营与持续演进
实现状态:待开发。此页是本期学习路线;真实代码与实测报告在完成故事后填写。
这一期学会什么:质量运营让系统在持续变化中仍可解释、可比较、可回滚。
为什么有这一期
使每次模型、Prompt、检索和语义变更都能被评测、监控与回滚。 进入条件:V5 可追踪工具链与历代评测产物可用。
本期链路
text
版本变更 → 冻结 Benchmark → 逐题比较 → 质量门禁 → 灰度 → 反馈 → 审核与改进跟读顺序
- 从 evaluation_run 记录读完整配置与数据谱系。
- 查看比较器如何处理顺序、重复、金额、NULL 与拒绝题。
- 从 dashboard 指标返回原始逐题结果,确认分母与分层。
- 跟一条反馈到审核、调优集或可信查询,检查去重与泄漏。
- 演练一次 CI 失败、一次灰度分组和一次版本协同回滚。
必做学习实验
让一个整体准确率更高、但财务关键题退化的配置触发门禁;模拟网络故障,确认不把基础设施错误统计成模型质量;回滚后核对模型、语义与索引版本。
记录输入、预测、实际输出、代码入口和失败原因;实验通过后再勾选相应任务。只有文档或 fake 运行不能替代真实集成与质量验收。
规模与验收门槛
累计 500+ Benchmark 问题;版本比较、反馈闭环、CI 门禁、灰度与回滚可演练。
完整功能与错误场景以本期计划为准。没有实测时所有指标保持“待测”;阶段完成还需要 通用 DoD。
设计取舍
大题库与持续评测需要时间和费用,PR 用快速集、发布用完整集,门槛来自基线与业务约束。不能为了更高分而降低测试隔离或删失败样例。
两分钟复述骨架
“每次变更绑定模型、Prompt、语义、检索、数据和题库版本。我们按域看逐题回退,用安全与质量门禁控制发布,线上反馈经过审核才回流。”
这段是练习骨架;当前未实现,不能直接当作已完成的面试经历。开发后补入你真正做过的失败实验、测试与数据。
实现后维护的代码导读
| 内容 | 当前记录 |
|---|---|
| 已验收任务及证据 | 暂无;以根目录 plan 为准 |
| 真实入口与关键函数 | 待实现后登记 |
| 上游/下游与数据契约 | 参考本期链路,完成后对照真实代码 |
| 正常与失败场景的命令 | 待实现后登记 |
| 实测指标与环境 | 待测 |
| 本期新决策与限制 | 完成后更新架构决策 |