Skip to content

V6|评测运营与持续演进

实现状态:待开发。此页是本期学习路线;真实代码与实测报告在完成故事后填写。

这一期学会什么:质量运营让系统在持续变化中仍可解释、可比较、可回滚。

打开本期 5 个故事 / 17 个任务 · 查看总进度

为什么有这一期

使每次模型、Prompt、检索和语义变更都能被评测、监控与回滚。 进入条件:V5 可追踪工具链与历代评测产物可用。

本期链路

text
版本变更 → 冻结 Benchmark → 逐题比较 → 质量门禁 → 灰度 → 反馈 → 审核与改进

跟读顺序

  1. 从 evaluation_run 记录读完整配置与数据谱系。
  2. 查看比较器如何处理顺序、重复、金额、NULL 与拒绝题。
  3. 从 dashboard 指标返回原始逐题结果,确认分母与分层。
  4. 跟一条反馈到审核、调优集或可信查询,检查去重与泄漏。
  5. 演练一次 CI 失败、一次灰度分组和一次版本协同回滚。

必做学习实验

让一个整体准确率更高、但财务关键题退化的配置触发门禁;模拟网络故障,确认不把基础设施错误统计成模型质量;回滚后核对模型、语义与索引版本。

记录输入、预测、实际输出、代码入口和失败原因;实验通过后再勾选相应任务。只有文档或 fake 运行不能替代真实集成与质量验收。

规模与验收门槛

累计 500+ Benchmark 问题;版本比较、反馈闭环、CI 门禁、灰度与回滚可演练。

完整功能与错误场景以本期计划为准。没有实测时所有指标保持“待测”;阶段完成还需要 通用 DoD

设计取舍

大题库与持续评测需要时间和费用,PR 用快速集、发布用完整集,门槛来自基线与业务约束。不能为了更高分而降低测试隔离或删失败样例。

两分钟复述骨架

“每次变更绑定模型、Prompt、语义、检索、数据和题库版本。我们按域看逐题回退,用安全与质量门禁控制发布,线上反馈经过审核才回流。”

这段是练习骨架;当前未实现,不能直接当作已完成的面试经历。开发后补入你真正做过的失败实验、测试与数据。

实现后维护的代码导读

内容当前记录
已验收任务及证据暂无;以根目录 plan 为准
真实入口与关键函数待实现后登记
上游/下游与数据契约参考本期链路,完成后对照真实代码
正常与失败场景的命令待实现后登记
实测指标与环境待测
本期新决策与限制完成后更新架构决策

延伸阅读

需求 → 代码 → 验证 → 复盘