3D 占据真值:仿真中的占据传感器
占据真值将连续空间离散为体素网格,并为每个体素标注是否被占据。BEV 感知、占据网络(Occupancy Network)等任务依赖此类三维标签;实车数据侧的人工或半自动标注成本高,而仿真中场景几何已知,适合批量生成监督信号。当前难点在于:不少平台未将「直接导出体素级占据标签」作为一等能力,或侧重机器人导航图,或依赖离线脚本单独跑管线。IADataSDG 提供原生占据传感器:在引擎内基于物理重叠判定体素占据状态,支持每帧独立网格、全局累积以及载体运动下仅增量更新新视域三种模式;输出采用binvox族格式,数据段以游程编码压缩连续相同标签,降低磁盘占用并便于对接常见体素工具链。截至 2026 年公开对比,面向车载、嵌入实时合成数据管线的 3D 占据输出仍相对少见。
问题:占据真值的来源与成本
三维感知需判断局部区域为占据或空闲。Occupancy Network、OccNet 等方法要求网络输出与3D 占据 ground truth在体素或投影表示上对齐。
真实数据往往依赖多传感器融合、人工校验或半自动标注,单价高、覆盖有限、难以规模化。仿真路径下,若仿真器能稳定、可重复地给出各体素与场景几何或碰撞体的重叠关系,标注边际成本可接近「多采一帧」。但并非所有平台都将该能力与相机、LiDAR 置于同一套采集流程中——尤其在自动驾驶场景,需与 ROI、帧率及多模态对齐一并考虑。
方案概述
三种工作模式(名称与项目内文档一致):
-
PerFrame(每帧快照)
每个仿真时刻生成独立体素网格。适用于逐帧监督:真值与当前传感器位姿、场景状态一一对应,不依赖跨帧状态。 -
Global(全局累积)
在世界固定坐标系中持续合并占据结果。适用于静态或缓变场景:关注「空间内哪些格子曾被占据」而非单帧快照。 -
Scanner(按块增量扫描)
适用于载体运动、视域逐步扩展:空间划分为块;已扫描块不重复全量查询,计算主要落在新进入视域的区域,利于长时程、大范围采集。实现上采用层级空间划分(由粗到细):大块若明显空或明显满,可避免对最细体素逐一枚举,在同等精度下于 CPU 侧支撑实时或准实时的合成采集。占据判定基于物理重叠,不依赖单帧渲染可见性或 GPU 负载。
感兴趣区域:车载设定中常见为轴对齐包围盒(车体周围长方体)或圆柱体(以自车为中心、水平截面为圆、高度受限)。传感器支持上述两种形状,便于与 BEV 网格、环视 ROI、近场安全区等对齐,减少后处理裁切。
输出形态:结果以binvox族格式写出;数据段采用RLE(游程编码),将连续相同标签压缩为「值 + 长度」,在稠密网格或大片空闲区域可显著节省磁盘与 IO。每次扫描可携带体素尺寸、网格维度、模式、占据率等元数据,便于训练脚本与数据集登记自动对齐。
应用价值
- BEV 感知模型训练:与多相机、多模态帧对齐的体素或投影占据真值。
- Occupancy Network / OccNet:稠密三维监督、体素级损失与评测指标。
- 三维场景理解、补全与规划:需要「空 / 占」语义与几何一致、可批量生成的仿真真值。
在 AI 模型训练中的价值
- 占据网络训练:SurroundOcc、FB-OCC、OpenOccupancy 等占据预测模型需要逐体素的 occupied / free 标签作为监督;真实数据的占据真值通常由多帧 LiDAR 累积 + 人工校验生成,成本高且覆盖有限。仿真逐帧即可给出精确占据网格,且支持 PerFrame 模式与每帧传感器位姿严格对齐,可直接作为训练监督或验证基准。
- BEV 感知联合训练:BEVFormer、BEVDet 等 BEV 模型常加入占据分支以学习 3D 几何表示;仿真中占据网格与多相机 RGB、深度、分割同帧输出,可构建多任务训练所需的完整输入–监督对,无需多套工具链分别生成再时间对齐。
- 3D 语义场景补全(SSC):LMSCNet、MonoScene、VoxFormer 等方法从稀疏输入补全稠密 3D 体素语义;占据真值可按需叠加类别信息(结合语义分割),直接生成 SSC 所需的 voxelized semantic ground truth。
- 规划与运动预测:UniAD、VAD 等端到端自动驾驶模型将占据预测作为规划前置;大量多样场景下的占据真值可帮助规划模块学习障碍物分布的先验,尤其对稀有布局(如施工区、狭窄巷道)的覆盖远超实采数据。
- 预训练表征:Occ-BEV、OccWorld 等工作表明占据预测可作为 3D 表征的自监督预训练任务;仿真提供的大量无标注成本的占据数据是此类预训练的理想数据源。
与常见竞品的差异
- Isaac Sim在占据相关能力上更多出现在机器人导航、场景理解图等语境,与「按帧、按 ROI、直接导出体素真值供占据网络使用」的产品形态并不完全重合。
- CARLA生态中可见CarlaSC等离线脚本生成体素或占据类数据,路径常为独立批处理,而非与采集开关一体、随跑随出的传感器模态。
- AirSim等在公开对比中未将原生 3D 占据传感器作为主打对标项。
因而在实时合成数据系统中,将层级空间查询、按块增量扫描、binvox 输出与多传感器采集置于同一流程——在 2025–2026 公开材料中仍较少见。对投入占据网络数据基建的团队而言,依赖自研脚本补全还是采用平台原生能力,将直接影响工期与可复现性。
参考文献
[1] Y. Wei et al., "SurroundOcc: Multi-Camera 3D Occupancy Prediction for Autonomous Driving,"ICCV, 2023.
[2] Z. Li et al., "FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation," arXiv:2307.01492, 2023.
[3] X. Wang et al., "OpenOccupancy: A Large Scale Benchmark for Surrounding Semantic Occupancy Perception,"ICCV, 2023.
[4] A. Cao, J. de Charette, "MonoScene: Monocular 3D Semantic Scene Completion,"CVPR, 2022.
[5] Y. Li et al., "VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion,"CVPR, 2023.
[6] Y. Hu et al., "Planning-oriented Autonomous Driving,"CVPR, 2023. (UniAD)
[7] Z. Li et al., "BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers,"ECCV, 2022.
[8] Z. Zheng et al., "OccWorld: Learning a 3D Occupancy World Model for Autonomous Driving," arXiv:2311.16038, 2023.