客户问题
智能系统的数据问题通常不只是“样本数量不足”,而是数据生产与模型研发彼此脱节:场景定义散落在文档中,仿真配置无法复用,采集与标注采用不同口径,数据集缺少完整版本关系,真机日志难以映射回仿真条件,现场失败也无法稳定转化为下一轮训练和回归数据。
常见障碍包括:
- 一次性交付难以迭代:数据按项目或批次交付后,场景参数、传感器配置和处理过程无法重放,需求变化时只能重新组织生产。
- 场景与数据脱节:文件保留了图像或点云,却没有关联任务、环境、参与者、传感器、随机种子和事件条件。
- 标注口径不统一:仿真真值、人工标注与模型伪标签采用不同类别、坐标和质量规则,数据合并后难以直接消费。
- 质量问题发现过晚:缺帧、时间不同步、标定错误、标签越界、坐标误用和分布偏差往往到训练阶段才暴露。
- 仿真与真机难以对齐:噪声、时延、内外参、环境分布和行为分布没有统一分析入口,仿真数据难以针对真实问题调整。
- 失败样本没有闭环:现场日志可以说明“发生了失败”,却缺少把失败条件复现、扩展并转化为训练集与回归集的机制。
- 数据资产不可追溯:数据集、模型、场景、资产、软件版本和评测结果缺少关联,难以回答某个模型究竟使用了哪些数据。
融合数据生产平台把上述环节组织为一条可定义、可执行、可检查、可追溯和可再次调用的数据生产线。
方案总览
平台以场景定义为生产起点,以版本化数据产品为交付对象,以真机数据和失败样本为下一轮生产输入,贯通以下链路:
场景定义 → 仿真运行 → 自动采集与标注 → 清洗质检 → 版本管理 → 分发调用 → 仿真与真机对齐 → 失败样本定向再生成
场景定义描述任务、环境、参与者、资产、传感器、采样分布和验收条件;仿真运行把定义编译为可执行任务,并记录每次运行的完整上下文;采集与标注管线同步输出传感器数据、系统状态和真值;清洗质检在数据进入训练前执行完整性、几何一致性和分布检查;版本管理把数据与场景、资产、引擎、算法和处理配方关联;分发层通过数据包、接口或挂载方式供训练、评测和分析系统调用。
真机数据进入同一治理体系后,用于校准传感器、环境和行为分布。失败样本被索引到对应场景因子和系统版本,再通过条件复现、参数扫描和反事实变体生成训练数据与固定回归用例。平台由此把数据交付从单次项目活动转化为持续循环的数据飞轮。
系统架构
平台采用七层架构:
| 层级 | 主要职责 | 核心产物 |
|---|---|---|
| 场景与任务定义层 | 描述业务任务、环境、对象、事件、传感器、分布和验收条件 | 场景规格、采样计划、数据需求 |
| 仿真执行层 | 编译运行配置、调度任务、管理种子、快照和运行状态 | 可重放仿真运行与运行清单 |
| 采集与标注层 | 同步采集多传感器数据、状态、轨迹、事件和真值 | 原始数据、自动标注、时间与坐标信息 |
| 数据工程层 | 清洗、转换、切分、增强、去重、异常检测和质量门禁 | 规范化样本与质量结果 |
| 数据治理层 | 管理目录、标签、血缘、版本、权限、审计和生命周期 | 版本化数据集与完整血缘 |
| 分发与调用层 | 提供数据包、查询、API、SDK、存储挂载和任务触发 | 面向训练、评测和分析的消费接口 |
| 对齐与再生成层 | 对比仿真与真机分布,重建失败条件并生成定向变体 | 校准参数、失败索引、补充集与回归集 |
贯穿各层的是统一数据清单。清单关联场景版本、资产版本、仿真引擎与插件版本、传感器配置、随机种子、采集时间、标注词表、处理配方、质量规则和访问权限。每个交付数据集都可以追溯到具体运行和具体生产条件。
核心能力
1. 场景定义
平台使用结构化方式表达数据需求,而不是仅以文件数量描述任务:
- 业务任务、运行区域、参与者角色和事件条件;
- 地图、环境、资产、本体与初始状态;
- 天气、光照、材质、遮挡、交通流或作业流程等环境因子;
- 相机、LiDAR、雷达、IMU、定位及其他传感器配置;
- 采样范围、参数分布、变量组合、随机种子和停止条件;
- 类别词表、标注模态、数据格式、切分规则和质量门槛;
- 正常工况、边界工况、异常工况和重点失败模式;
- 训练、验证、测试与固定回归用途。
场景规格与数据规格分离:同一场景可按不同传感器和标签要求采集,同一数据需求也可在不同场景族上执行。
2. 仿真运行
执行层把场景规格编译为运行任务,完成资源装载、参与者初始化、传感器配置、事件调度和采集控制。每次运行保留:
- 场景、资产、本体和策略版本;
- 引擎、插件、配置和运行环境信息;
- 随机种子、参数取值和初始状态;
- 时间轴、事件、状态快照和终止原因;
- 采集文件、日志、异常和质量状态。
任务可以按场景族、参数组合或失败条件批量组织,并通过快照和种子重放关键运行。运行异常与数据质量问题分开记录,便于区分“仿真没有完成”和“仿真完成但数据不合格”。
3. 自动采集与标注
采集管线在统一时间与坐标约定下输出多源数据:
- RGB、BaseColor、深度、法线、光流和边缘等视觉模态;
- 语义分割、实例分割、材质分割和可见性信息;
- 2D/3D 包围框、对象位姿、速度、轨迹和生命周期;
- LiDAR 点云、雷达、IMU、定位与其他传感器数据;
- 占据、可通行区域、接触、碰撞和任务事件真值;
- 本体状态、控制量、策略输出和环境状态;
- 相机内参、传感器外参、时间戳、坐标变换与标定信息。
自动标注直接来源于仿真世界状态和渲染、物理管线,避免把人工标注误差带入合成数据。标注规则、类别词表和格式转换均纳入版本管理。
4. 清洗与质量控制
质量管线从文件、时间、几何、语义和分布五个层面检查数据:
- 文件完整性:文件缺失、损坏、重复、大小异常与清单不一致。
- 时间一致性:时间戳单调性、跨传感器同步、掉帧、采样频率与延迟。
- 几何一致性:内外参、坐标变换、深度、点云、2D/3D 投影和遮挡关系。
- 语义一致性:类别映射、实例连续性、标注空值、标签越界和跨模态一致性。
- 运行有效性:场景初始化、任务完成、碰撞、异常终止和采集状态。
- 分布覆盖:场景因子、类别、距离、遮挡、天气、事件和失败模式的覆盖情况。
- 数据泄漏:训练、验证、测试与回归集之间的场景、序列或近重复样本检查。
不合格样本进入隔离区并保留原因码;可修复问题进入重处理队列,需要重新仿真的问题返回对应场景和运行任务。
5. 版本、血缘与权限管理
平台为资产、场景、运行、原始数据、派生数据、标注、质量规则和数据集分别建立版本,并通过血缘关系连接:
数据集版本 → 样本版本 → 处理配方 → 仿真运行 → 场景与资产 → 传感器与软件配置
模型训练或评测任务可以反向记录所消费的数据集版本。数据更新时,平台能够识别受影响的派生产物和消费任务。权限按组织、项目、数据级别和操作类型配置,下载、修改、发布与删除均可审计。
6. 分发与调用
数据不局限于人工下载,可按下游系统需要提供:
- 冻结的数据集包、清单和校验值;
- 对象存储、文件系统或数据仓库挂载;
- 按场景、事件、标签、质量和版本查询的 API;
- 面向训练脚本、评测任务和 Agent 的 SDK;
- 数据转换、抽样、切分和导出任务;
- 通过数据集标识锁定版本的可复现实验入口;
- 面向在线回归或持续训练的增量订阅。
分发记录与数据版本绑定,确保消费方使用的内容、格式和权限均可追踪。
7. 仿真与真机对齐
真机数据与仿真数据采用共同的任务分类、场景标签、时间与坐标约定,并围绕以下维度对齐:
- 传感器内参、外参、采样频率、曝光、扫描方式和时间延迟;
- 图像噪声、点云噪声、丢点、漂移、畸变和测量范围;
- 天气、光照、材质、遮挡、背景和对象外观;
- 对象类别、尺寸、速度、距离、姿态和交互行为;
- 本体动力学、执行器响应、控制延迟和状态估计误差;
- 事件频率、失败模式和业务任务分布。
对齐结果转化为传感器模型参数、场景采样权重、资产修正项和质量规则。平台保留调整前后的数据版本,使分布变化能够被评测和回溯。
8. 失败样本定向再生成
平台将真机日志、评测失败和模型退化统一转化为可执行的数据任务:
- 解析失败发生时的观测、状态、动作、环境和软件版本。
- 将失败关联到场景对象、事件、传感器和系统模块。
- 重建可重复的初始条件与关键时间窗口。
- 围绕可疑因子执行单变量扫描、参数邻域采样和反事实分支。
- 自动采集并质检新样本,形成针对性的训练补充集。
- 冻结代表性失败条件,形成版本回归集。
- 将训练结果送回同一回归基线,检查问题修复与其他场景退化。
失败样本因此不再停留在问题单和日志附件中,而成为可复用的场景、数据和评测资产。
业务流程
首轮数据生产
- 明确算法任务、数据模态、标签规范、数据格式和验收条件。
- 建立场景因子、资产、本体、传感器与采样分布。
- 编译并运行仿真任务,记录场景、配置、种子和运行状态。
- 同步采集数据、自动标注、系统状态和真值。
- 执行清洗、格式转换、几何检查、语义检查和分布分析。
- 按训练、验证、测试与回归用途切分并冻结数据版本。
- 通过数据包、存储或接口向训练与评测系统分发。
真机对齐
- 接入真机传感器数据、系统日志、标定信息和任务上下文。
- 统一时间、坐标、类别、事件和数据格式。
- 对比仿真与真机在传感器、环境、对象、行为和失败模式上的分布。
- 更新传感器参数、场景采样权重和质量规则。
- 生成对齐后的补充数据,并在固定基线上验证。
数据飞轮
- 模型训练和评测产生结果、错误和失败样本。
- 失败索引回连场景、数据、模型和软件版本。
- 平台复现失败并生成条件邻域与反事实样本。
- 新数据进入质检、版本和分发流程。
- 模型更新后使用固定回归集与新增失败集重新评测。
- 结果继续进入下一轮场景定义和数据生产。
典型场景
换了新相机,却要等三个月才有数据
一家做仓储 AGV 的团队换了一款新相机,想训练一个“识别地面障碍物”的模型。按老办法,得先等样机装好、推到仓库里跑上几个月收集画面,再雇人一帧一帧把障碍物框出来——这几个月里算法团队基本无事可做,只能干等数据。
我们在仿真里按他们的相机型号、安装位置和实际作业场景,直接生成大量画面,并自动标好每个障碍物的位置和类别,不需要人工一帧帧去框;等真机数据陆续到位,再用它来校准和补充。
于是算法团队在样机还在装配的时候就能开始训练,几个月的空窗期变成“边仿真边推进”;省掉大部分人工标注的花费;那些平时难得一见的障碍物也能提前造出来练,模型上线时更稳。
一年遇不到几次的危险场景
一家做自动驾驶的团队,最担心的是那种“一年碰不到几回”的情况:暴雨里突然窜出来的行人、掉在高速路上的轮胎。真实路测很难专门蹲守这些场景,更不可能为了收集数据故意制造危险。
我们在仿真里按需把这些罕见、危险的场景造出来,要多少造多少,还能连同“当时的天气、位置、车速”这些设定一起交付,保证以后能一模一样地重现。
这样原本靠运气加大量路测才能偶遇的场景,现在可以定向批量生产,既省钱又没有安全风险;针对这些极端情况反复训练,模型在关键时刻更靠得住。
把现场故障变成训练数据
一家做配送机器人的公司,产品上线后陆续收到现场故障:机器人在某种玻璃门前定位丢了、在某个坡道上打滑。这些故障现在只写在售后工单里,工程师在办公室很难重现,更别说把它变成能拿来训练的数据。
我们把现场故障还原成仿真里可以反复重演的场景,再围绕出问题的那个因素(比如反光、坡度)造出一批相似样本用于训练,并把这个故障固定下来,作为以后每次升级都要通过的“考题”。
现场“救火”于是变成办公室里的线上迭代,修得更快、出差成本更低;固定考题保证老毛病不会改着改着又犯——产品每遇到一次故障,能用的数据就厚一分。
交付形式
- 场景定义、数据规格、标签词表和质量标准;
- 仿真任务编排、运行管理和自动采集标注服务;
- 多模态数据处理、格式转换、清洗与质检管线;
- 数据目录、版本、血缘、权限与审计服务;
- 数据查询、导出、挂载、API、SDK 与 Agent 调用接口;
- 仿真—真机对齐工具、校准参数与分布分析报告;
- 失败样本索引、复现场景、定向训练补充集与固定回归集;
- 按用途冻结的数据集、清单、校验值和质量报告;
- 面向企业内网、私有云或混合环境的部署与运维文档。
平台可按模块接入客户已有仿真引擎、数据湖、训练平台和评测系统,也可作为完整数据生产链路交付。
客户价值
- 把数据需求变成可执行规格:场景、传感器、标注、分布和验收条件在生产前统一。
- 提高数据可复现性:每个样本关联运行配置、场景版本、资产版本和随机种子。
- 降低质量问题后移成本:在训练前发现缺帧、标定、坐标、标签和分布问题。
- 统一仿真与真机治理:两类数据共享任务、场景、版本、质量和消费接口。
- 缩短失败修复链路:现场失败可直接进入复现、再生成、训练和回归流程。
- 保护研发可追溯性:数据集、模型、实验和评测结果通过血缘关系关联。
- 支持持续的数据飞轮:每次运行、训练、评测和部署反馈都能转化为下一轮数据资产。