评测、追踪与 NL2SQL Ops
状态:规划中的业务模块。关联任务:V0-S06、V1-S05、V2-S06、V6-S01~V6-S05;查看实施计划。真实函数和测试路径由阶段开发完成后补入。
业务问题
模型、Prompt、语义或检索发生变化,系统必须知道哪些题变好、哪些题变坏,以及付出了多少成本。
输入、输出与上下游
- 输入:冻结题库、Gold 或预期行为、数据快照、完整配置版本、逐题 Trace 与人工反馈。
- 输出:评测报告、失败分类、发布决策、回退样本及改进任务。
Benchmark → Runner → Controlled Pipeline → Comparator → Metrics → Gate → Canary / Rollback核心机制
执行准确率必须声明分母:可执行问数题中满足 Gold 结果比较规则的比例。权限与澄清题应单独统计预期行为,不因为没有 SQL 就算失败。语义正确性还需规则/人工复核。
无 ORDER BY 的结果比较要忽略行序但保留重复次数;带排序的 Top N 要比较顺序,并定义并列规则。Decimal 金额、浮点容差、NULL、空结果均需比较器规范。
Recall@K 可按题计算再 macro 平均,也可汇总 micro;报告必须明确口径。P95 从原始请求时延分布得到;修复率、首次成功率与总成功率使用不同分母,不能混用。
CI 门禁先运行快速集,发布时运行完整冻结集;回退案例与随机波动分别处理。安全集出现越权放行必须阻断,但通过有限测试不证明所有攻击都已防住。
失败与边界
网络故障:标成运行不可用而非模型质量下降;版本不全:不可严格比较;总体提升但财务回退:分域门禁仍阻断;反馈未审核:不能自动进入可信样例。
学习实验
固定数据和模型,故意移除销售额的 is_test 过滤,让语义回归失败;恢复后观察门禁通过。再修改行序,确认比较器不会误判无序结果。
先写预测结果,再执行;把实际输出、数据版本和代码入口放进 验收证据。现在尚无业务实现,此处实验需要对应阶段完成后运行。
读代码与面试复述
90% 准确率的分母是什么?为什么测试题不能进入 Verified Query?怎样证明重排收益抵得上延迟和成本?
阅读时先看契约,再跟一条正常链路和一条失败链路,最后读 adapter 与测试。使用 代码地图 定位模块;不要只背技术名称。