Skip to content

V6|评测运营与持续演进

状态:待开发。全部任务默认未完成;本文件是勾选状态的唯一来源。 依据:原始总纲第 41 节;以下故事、编号、接口与验收细则为本次实施设计。

阶段目标

使每次模型、Prompt、检索和语义变更都能被评测、监控与回滚。

  • 进入条件:V5 可追踪工具链与历代评测产物可用。
  • 规模 / 质量约束:累计 500+ Benchmark 问题;版本比较、反馈闭环、CI 门禁、灰度与回滚可演练。
  • 阶段依赖:V0 → V1 → V2 → V3 → V4 → V5 → V6。故事内任务按编号顺序执行,故事间按下列依赖执行。
  • 建议路径均为规划位置,尚未存在;实现时允许简化文件拆分,但必须更新学习站真实代码索引。
  • 完成标准:本期任务全部满足 通用 DoD,证据登记到 验收记录

V6-S01|统一版本与评测运行

用户故事:作为评测负责人希望每个分数绑定完整实验环境,能够复现。

依赖:V5-S05。
建议落点server/evaluation、benchmarks、apps/admin
学习目标:实验谱系、版本矩阵、可复现比较。

开发任务

  • V6-S01-T01 记录 Prompt、模型配置、embedding、reranker、retriever、semantic、schema、benchmark、dataset 与代码版本及 run_id。
  • V6-S01-T02 建立累计 500+ 题 Benchmark,按域、难度、能力、安全和问题家族分层;保存训练/调优/锁定测试边界。
  • V6-S01-T03 用 Celery 执行批量评测,支持排队、取消、重试、断点和任务幂等;保存逐题结果与比较器版本。
  • V6-S01-T04 管理端实现 Benchmark 编辑/版本冻结、运行详情和两个版本的逐题差异。

验收场景

无法确认完整版本的历史分数标为不可严格比较;同一评测重试不重复计数;权限/澄清题有专门预期行为。

完成后应提供:相关测试或演示命令、实际结果、真实代码入口和一段“为什么这样做”的说明。仅创建文件不满足验收。

V6-S02|指标仪表盘与失败分析

用户故事:作为模型负责人希望区分质量、安全、运行和成本变化,并定位回退题。

依赖:V6-S01。
建议落点server/evaluation/metrics、apps/admin
学习目标:分位数、分母、置信区间与分层诊断。

开发任务

  • V6-S02-T01 实现召回、生成、执行、语义、安全、首次成功、修复、超时、澄清、缓存命中、P50/P95、token 与成本指标。
  • V6-S02-T02 明确每项分母和统计窗口,拒绝题不混进 SQL 执行准确率;成本按有来源和日期的模型价格配置计算。
  • V6-S02-T03 仪表盘按域/难度/版本筛选,展示失败分类、逐题回退、样本量与置信区间或波动范围。

验收场景

总体提升但财务域回退时仍可见;未测指标显示“待测”而非 0;P95 根据原始请求分布计算而非平均各批 P95。

完成后应提供:相关测试或演示命令、实际结果、真实代码入口和一段“为什么这样做”的说明。仅创建文件不满足验收。

V6-S03|反馈与失败挖掘

用户故事:作为分析师希望线上失败能进入改进流程,而不自动变成错误训练数据。

依赖:V6-S02。
建议落点server/evaluation/feedback、apps/web、apps/admin
学习目标:人工审核、隐私、去重与反馈闭环。

开发任务

  • V6-S03-T01 支持用户对问题/结果反馈正确性与口径问题,关联 trace_id 并允许最小必要的说明。
  • V6-S03-T02 脱敏并按根因聚类失败,建立 triage → reviewed → benchmark/example → verified 状态与负责人。
  • V6-S03-T03 审核后进入调优集或可信查询,避免进入已冻结测试集造成污染;保留变更与复验来源。

验收场景

一个错误点赞不会自动发布 Verified Query;反馈中的敏感数据不进入 embedding;重复事件可合并但不丢统计数量。

完成后应提供:相关测试或演示命令、实际结果、真实代码入口和一段“为什么这样做”的说明。仅创建文件不满足验收。

V6-S04|Prompt / 模型管理与 CI 门禁

用户故事:作为开发者希望提交配置变更时自动发现质量回退,并阻止危险发布。

依赖:V6-S01、V6-S02。
建议落点server/llm/config、apps/admin、scripts/evaluate_ci、.github/workflows
学习目标:质量门禁、配置发布、确定性与概率性回归。

开发任务

  • V6-S04-T01 实现 Prompt、模型、embedding、reranker 与检索配置版本管理,支持差异比较与回滚,密钥只存引用。
  • V6-S04-T02 按变更范围运行 PR 快速集和发布完整集,固定数据与模型参数;记录随机波动及必要复跑规则。
  • V6-S04-T03 配置关键域语义回退、越权放行、安全绕过、时延和成本预算门禁;阈值从基线和业务约束形成版本化文件。
  • V6-S04-T04 生成机器可读报告与失败退出码,演示一次好变更通过和一次安全/语义回退被阻断。

验收场景

任何锁定安全例越权放行导致 CI 失败;网络失败不会被计为模型准确率下降;不能删除失败题来通过门禁。

完成后应提供:相关测试或演示命令、实际结果、真实代码入口和一段“为什么这样做”的说明。仅创建文件不满足验收。

V6-S05|灰度、成本治理与最终复盘

用户故事:作为平台负责人希望小范围观察新版本,异常时恢复旧行为。

依赖:V6-S03、V6-S04。
建议落点server/observability、deploy/runbooks、altassql-book/interview
学习目标:灰度、对照组、回滚一致性、证据化面试。

开发任务

  • V6-S05-T01 按服务端稳定用户/会话分组灰度,固定每次查询的配置快照;定义扩大、暂停、回滚条件。
  • V6-S05-T02 监控质量反馈、错误、延迟和成本,设置每用户/任务预算;执行模型、语义及索引版本协同回滚演练。
  • V6-S05-T03 输出 V0~V6 演进报告、架构决策、关键失败、实测数据、运行手册与面试案例;核对所有需求均有任务与证据。

验收场景

回滚后新请求使用旧版本且在途请求可解释;仪表盘能区分灰度与对照组;最终报告没有把目标指标冒充实际成绩。

完成后应提供:相关测试或演示命令、实际结果、真实代码入口和一段“为什么这样做”的说明。仅创建文件不满足验收。

阶段演示与复盘

  1. 从本期故事选一条完整用户流程,按输入 → 中间产物 → 输出演示。
  2. 演示上述验收中的一个失败/拒绝场景,解释负责处理的模块。
  3. 固定环境和数据版本,提交本期验收报告;未达到的目标登记阻塞原因。
  4. 在学习站 stages/v6.md 补充已实现代码入口、调用关系、实测结果及面试复述。
  5. 复查本期 5 个用户故事、17 个开发任务的证据,再由执行者勾选。

复盘问题:本期解决了上一期哪类具体失败?增加了什么复杂度?有什么证据证明收益?下一期需要解决什么剩余问题?

需求 → 代码 → 验证 → 复盘