11 张 ADS 数据闭环表开箱即用智驾数据产品矩阵全览

11 张 ADS 数据闭环表开箱即用智驾数据产品矩阵全览 湖仓里躺着 PB 级数据业务方却还在问「这个月的闭环耗时是多少哪个环节在积压」——数据在库里不等于数据在手上。从原始事实到业务方能直接消费的产品中间隔着一次关键的「产品化」加工把散落在 DWD/DWS 层的明细与聚合按业务问题物化成一张张开箱即用的表。前四篇我们讲完了闭环全景、行业对标、架构蓝图与全局 ID。本篇看蓝图的最后一块拼图——ADS 应用数据层StarRocks 离线加工 DWS/DWD 层数据并物化为StarRocks 内表毫秒级直查共11 张开箱即用的数据产品表从闭环效率大盘到存储成本看板直接服务各业务平台。这是「小周谈智驾数据闭环」系列一的第五篇。你将看到一、为什么需要「门面」层数据 ≠ 产品先看三个真实的业务问题这些问题如果每次都从 ODS/DWD 明细现场聚合要么查询太慢要么口径各写各的。ADS 层的职责就是把答案预先算好StarRocks 离线加工 DWS/DWD 层数据物化为 StarRocks 内表T1 批加工、毫秒级直查。每张表都回答一类明确的业务问题业务平台直接取数渲染无需理解湖仓分层。一句话定位ODS/DWD 存事实DWS 存聚合ADS 存答案。二、11 张表全景按业务问题归类的产品矩阵11 张表不是随意堆出来的而是按「谁在什么场景下要回答什么问题」设计的。先看全景按业务主题归成六组闭环健康度1、2、数据质量资产3、4、5、资产运营6、模型迭代与上车7、8、9、成本治理10、挖掘运营11。下面按组逐一拆解每张表给出服务对象、核心指标与一个真实业务场景。三、闭环健康度大盘与瓶颈的两级下钻表 1 · 闭环大盘指标表按「统计日期 × 项目代码」T1 加工回答闭环整体健康度总数据量与月度新增、平均闭环耗时车端触发 → OTA 部署各环节时长汇总、Badcase 解决率、各状态数据量分布、数据增长率与效率提升率。大屏首屏用 KPI 指标卡 多线趋势图一眼看闭环转得快不快、质量好不好。一个真实的优化案例表 2 · 产线瓶颈分析表是大盘的下钻层按「统计日期 × 项目代码 × 产线环节上云/前处理/标注/质检」计算各环节平均耗时、瓶颈环节标识耗时占比超阈值或环比恶化自动标记、积压数据量与吞吐量/质检通过率。典型场景产线连续 3 天告警标注环节被识别为瓶颈——积压1.5 万条、平均耗时 72 小时占全链路 55%数据管理平台调度标注团队扩容并引入预标注模型一周后标注耗时降至36 小时、积压清零产线恢复满吞吐。两级下钻的分工大盘看「闭环慢不慢」瓶颈表定位「慢在哪个环节」——度量先行优化才有靶心。四、Badcase 即资产根因、场景、难例三张表闭环里最值钱的不是原始数据而是从问题中提炼出的定向改进线索。三张表把 Badcase 变成可运营的资产根因分布表表 3按根因分类/子分类统计数量、占比与趋势。模型 v3.2 评测产出 3,200 个 Badcase分布显示感知漏检占45%其中夜间行人占28%且趋势上升 → 问题分析平台把结论推送挖掘平台定向补采 2,000 条重训该类漏检下降 60%场景库汇总表表 4按「场景类型 × 场景标签」统计总量、高质量量、关联 Badcase 与覆盖度。场景库定义 1,200 个标签、覆盖度82%盘点发现「施工区域」仅150 条达标线 2,000 条且 Badcase 逐月上升 → 生成场景缺口清单定向补采两周后达标、状态流转 COVERED难例库表表 5按「难例类别 × 来源 × 模型版本」统计数量、采纳率与闭环验证效果。v3.2 评测挖出3,200 条难例夜间行人 900、逆光车辆 700训练平台采纳2,800 条采纳率 87.5%混入 v3.3 训练集重训后夜间行人漏检率下降60%——难例闭环的价值被完整量化三张表串起来是一条完整的线索链根因表告诉你「错在哪类问题」场景表告诉你「哪类场景缺数据」难例表告诉你「补进去有没有效」。Badcase 从事故记录变成了驱动下一轮采集与训练的燃料。五、迭代与上车版本对比、OTA 与触发热力图模型从训练完成到真正上车还要过三道「数据产品」关表 7 · 模型版本对比表按「模型版本 × 数据集 × 场景类型」对比通过率、Badcase 率、平均指标分与基线对比。真实案例v3.3 与 v3.2 在「城区 NOA 评测集 v5」对比——总体通过率91.2% vs 87.5%夜间场景显著提升8.3pp难例闭环见效但高速场景回归-1.2pp→ 评测平台标记回归项定位到车道线检测变更修复后再 OTA避免带病上车。表 8 · OTA 部署汇总表按「统计日期 × 车型 × 软件版本」统计升级任务数/车辆数、成功率、灰度进度与发布后回传触发量。v3.3 灰度推送 500 台车升级成功率99.2%发布后一周回传触发量环比增长30%新版本主动采集策略生效安全相关问题 0 起 → 确认全量推送回传数据反哺下一轮训练闭环真正转动起来。表 9 · 触发事件热力图表按「统计日期 × 车型 × 触发类型 × 地理网格」统计触发总量、上传/处理完成率与入数据集量。热力图显示触发集中在城区晚高峰路口某区域「AEB 误触发」周环比上升45%→ 问题分析平台关联该区域回传数据定位到逆光路口场景挖掘平台下发定向采集需求补数重训后误触发率回落。三张表首尾相接版本对比守住「不上带病模型」的底线OTA 汇总盯住「上车过程可控」热力图把「上车后的问题」变成下一轮闭环的入口——部署不是终点而是新数据的起点。六、运营底盘资产目录、存储成本与挖掘标签最后一组表服务于「让闭环可持续运转」的运营视角表 6 · 数据资产目录表按「资产类型 × 负责人」登记数据集/场景库/难例库/评测集的注册数、使用次数与质量评分。「城区 NOA 主数据集 v12」本季度被12 个训练任务引用、质量评分4.6列为核心资产同期 3 个低分老旧数据集长期无人使用 → 标记归档释放存储资产目录保持「新鲜可用」。表 10 · 存储成本看板表是成本治理的仪表盘按「存储介质 × 生命周期分层 × 数据类型」呈现容量、成本、治理动作量与节省额。月末复盘的真实数据成本增速 1.8% 对数据增速 35%——这就是治理规则有效的直接证据同期预热命中率 91%、归档取回 23 次/日均处健康区间无需调阈值。表 11 · 挖掘标签分布看板表盯住标签资产的健康度三来源采集/规则/模型标签量构成、clip 覆盖率、向量化率、检索热度与候选池待审量。周会看盘实例SCENE 类标签覆盖率78%环比 5pp规则挖掘贡献 42%、VLM 推理 31%、采集携带 27%「雨天夜间」标签 7 日增长23%且检索命中156 次全库 Top3→ 优先保障其向量化队列同期候选池待审 320 个触发审核流清理防止标签爆炸。