自动驾驶数据闭环:NeuraVoxel 从采集到回流
多源采集难对齐,标注—训练—仿真之间版本漂移。我们以 DMP 为中枢,把四个断点逐个连接,形成可追溯的产业数据闭环。
自动驾驶数据的闭环挑战
自动驾驶研发产生海量多源数据:路采、仿真、标注、训练、验证。理想状态下,这些数据应该形成一个闭环——采集的数据经过标注进入训练,训练产物进入仿真验证,仿真发现的难例写回数据中枢,启动下一轮迭代。
现实往往不是这样:
- 多源采集难对齐:不同传感器、不同批次、不同格式,难以统一管理
- 标注—训练版本漂移:标注完成的数据集与训练使用的版本不一致
- 仿真结果无法回流:仿真评估发现的 corner case 难以结构化写回
- 权限与分发混乱:团队间数据共享缺乏版本追溯
DMP 作为中枢
NeuraVoxel 的 DMP(数据管理平台)不是环上的一个步骤,而是驱动整个环的中枢。它负责:
- 数据集组织与版本管理
- 权限控制与分发
- 与标注、训练、仿真模块的数据契约
环上的其他模块——标注桥、训练桥、仿真桥——都是与 DMP 对齐的「连接器」,各自攻克环上的一个断点。
四个断点,逐个连接
| 断点 | 模块 | 攻克方式 |
|---|---|---|
| 标注任务下发与结果回流 | 标注桥 | 与 DMP 按清单对齐,保证版本一致 |
| 训练数据拉取与产物登记 | 训练桥 | 版本化数据集拉取,训练产物登记回 DMP |
| 仿真场景分发与评估回流 | 仿真桥 | 场景包分发,难例数据写回 DMP |
| 多源数据组织与分发 | DMP 中枢 | 统一入口,驱动全链路 |
可追溯,才能迭代
闭环的价值不在于「数据流动」,而在于可追溯的迭代。每一次标注、每一次训练、每一次仿真,都应该能追溯到具体的数据版本,并推动环向前走。
这就是 NeuraVoxel 在自动驾驶场景的实践——不是造更大的平台,而是把环上的断点逐个连接,让数据真正闭环。