元数据与数据源
状态:规划中的业务模块。关联任务:V0-S04、V0-S05、V0-S07;查看实施计划。真实函数和测试路径由阶段开发完成后补入。
业务问题
数据源接入后,系统要知道表字段是否存在、数据粒度是什么、哪些字段敏感。只靠表名不足以支持生成 SQL。
输入、输出与上下游
- 输入:数据源配置、凭据引用、反射结果和管理员补充信息。
- 输出:带稳定对象 ID、技术结构、业务说明和版本的 MetadataSnapshot。
text
Admin API → DataSourceService → MetadataCrawler → MetadataRepository → SyncJob → Search Index核心机制
技术字段由采集器维护;业务名、别名、粒度和敏感等级由治理过程补充。增量同步不能用技术注释覆盖人工说明。对象删除后应变为失效对象,再驱动索引重建或删除,而不是从控制库消失却仍能被召回。
同步任务应分为采集、保存快照、构建派生索引、验证、发布。失败保留旧版本,不能把部分完成快照当作当前 schema。
失败与边界
业务库断连:任务失败可重试;字段改名:旧对象失效、影响报告可见;样例包含手机号:索引前脱敏或禁止采集。
学习实验
在 tiny 业务库新增一列,再同步两次:应只产生一次语义变更,不产生重复对象;人工设置的粒度说明仍保留。
先写预测结果,再执行;把实际输出、数据版本和代码入口放进 验收证据。现在尚无业务实现,此处实验需要对应阶段完成后运行。
读代码与面试复述
为什么控制库与业务库要用不同账户?采集结果为什么需要版本?后台任务重试为什么会导致重复写?
阅读时先看契约,再跟一条正常链路和一条失败链路,最后读 adapter 与测试。使用 代码地图 定位模块;不要只背技术名称。