SDG 合成数据 IADataSDG

合成数据中的深度:定义、透明物体与多目几何

深度估计、立体视觉、多相机几何,或关注玻璃等透明物体在深度中的表示。

2026-04-09 6 分钟阅读
文章目录10

合成数据中的深度:定义、透明物体与多目几何

概述

训练与评测中所说的「深度」并非单一物理量:既有沿相机前向轴的距离,也有从光心到场景点的直线距离;透明物体在 RGB 中可见,主深度缓冲中却可能未体现遮挡;多相机应用还需要同一时刻、同一场景状态以及每路相机各自的内外参,立体视觉才有意义。IADataSDG 在实时管线中可同时提供沿轴深度直线距离(欧氏深度),以及覆盖透明层的扩展深度,并支持多相机一致输出。


背景与意义

  • 深度定义若与实机雷达、ToF 或文献约定不一致,模型在尺度与边界上易出现系统性偏差。
  • 若不对透明物体做补充,RGB 与深度的语义可能不一致
  • 双目 / 多目立体:仅采集左右图像不足以保证可用性,还需时间对齐、共享场景状态,以及每路相机标定信息明确,对极几何与三角化才能成立。

两种深度:同名不同义

  • 平面深度(沿视线轴 / 视图 Z):沿相机前向(视线方向)测量的距离,与经典**透视(针孔)**投影关系最直接。
  • 欧氏深度(斜距):从光心到场景点的直线长度。画面边缘处,斜距通常大于沿轴深度;离光轴越远,差异越明显。

二者可互相换算。设 (V_x, V_y) 表示该视线在成像平面上的归一化偏移(与视场及像素位置相关),则:

[ \text{欧氏深度} = \text{平面深度} \times \sqrt{1 + V_x^2 + V_y^2}. ]

即:边缘像素对应的三维路径更倾斜,在相同「沿前向深度」下,实际路径长度需乘以大于 1 的系数。

渲染与硬件侧较易稳定提供的是沿投影方向的量;不少激光与 ToF更常报告斜距。同时提供两种语义,便于按任务选用,避免混用定义。


透明物体与主深度缓冲

在常见实时渲染中,不透明物体先写入主深度;透明物体往往经单独合成路径,不会自动进入该主深度。因而会出现 RGB 可见玻璃、主深度却似「未遮挡」的现象。

工程上常见做法是:独立通道记录透明物应表现的距离,或在内容侧使用不可见的简化不透明代理几何,将有效遮挡距离写入深度。本质是用几何或附加缓冲补全语义,而非假设单张主深度天然包含全部透明物。

路径追踪类方案在折射与透明深度上往往更直接;传统实时仿真中「仅不透明主深度」更为常见。


深度缓冲约定(Reversed-Z)

许多现代引擎(含 Unreal)采用Reversed-Z深度编码:近处在缓冲中接近1远处接近0(与早年「近小远大」相反)。这样浮点精度在远距离分布更均匀,减轻远处量化条纹。合成数据还原为米制或其他物理单位时,须与引擎约定一致,否则数值表面合理、语义却相反,会导致立体与点云整体错位。


双目与多目的最低要求

  • 时间对齐:同一仿真时刻、同一套场景状态下输出的多路图像,避免左右帧时间差引入虚假视差。
  • 同一场景与光照:多路视图应对应同一渲染语义下的世界状态,而非各自独立的随机种子。
  • 每路相机的内参(焦距、主点等)与外参(位姿),以结构化方式随帧给出。

上述条件构成多相机一致数据,可直接用于立体匹配、多视深度、自监督深度,并与经典对极几何对齐。教材可参考 Hartley & Zisserman《多视图几何》、Szeliski《计算机视觉》中立体与三维重建章节。


与竞品对比

维度CARLAAirSimIsaac Sim(RTX)BlenderProcIADataSDG(UE5.7)
平面深度✓(离线)✓ 实时
欧氏深度公开能力上多不强调与平面并列类似多不强调产品化欧氏输出✓ 与平面并列实时
透明相关完整深度✓ RTX 更自然✓ 路径追踪✓ 额外通道 / 代理几何
实时性近实时实时类实时类离线为主实时

CARLA等常用编码深度便于存盘,未必在同一产品形态中原生提供可与斜距对照的欧氏深度。Isaac在 RTX 标注下对透明更友好。BlenderProc离线质量突出。IADataSDG在实时条件下同时提供平面与欧氏深度;极宽视场经立方体展开路径时,公开对比中以欧氏深度语义为主;透明侧以附加深度与代理思路补全。


在 AI 模型训练中的价值

  • 单目深度估计:MiDaS、ZoeDepth、Depth Anything 等方法在大规模多域数据上训练时,合成深度提供精确到像素的稠密监督,弥补真实 LiDAR 投影后仅 ~5% 像素有深度的稀疏性。同时提供平面与欧氏两种定义,可按模型假设选用或联合训练。
  • 立体匹配:RAFT-Stereo、CREStereo、UniMatch 等双目方法依赖左右视图 + 视差真值三元组;仿真保证严格同步与已知基线,免去实拍标定残差对训练的干扰。多相机一致输出直接可用,不需额外同步硬件。
  • 深度补全:稀疏 LiDAR 深度 → 稠密深度的任务(如 PENet、CompletionFormer)需要稠密深度作为监督;仿真天然提供每像素稠密值,同时提供对应的稀疏 LiDAR 点云,构成完整的稀疏–稠密训练对。
  • 透明物体深度:ClearGrasp 等针对透明物体深度估计的方法需要透明物体的真实深度标注——这在实拍中几乎不可能获得。扩展深度通道提供了覆盖玻璃、水体等透明层的监督信号。
  • 自监督深度与位姿:Monodepth2、PackNet 等自监督方法以光度一致性为损失;合成数据可提供精确深度作为验证基准,帮助判断自监督信号是否有效收敛,而非仅依赖下游任务间接评估。

选用要点

  • 需要的是与投影、SLAM 一致的沿轴深度,还是与雷达一致的斜距,或二者兼备?
  • 场景中玻璃、水体是否较多?是否需要「完整深度」而不仅依赖主缓冲?
  • 是否开展多相机学习?除图像外,是否验收同步、内外参及深度约定(含 Reversed-Z)

参考文献

[1] R. Ranftl et al., "Towards Robust Monocular Depth Estimation: Mixing Datasets for Zero-Shot Cross-Dataset Transfer,"IEEE TPAMI, vol. 44, no. 3, 2022.

[2] S.F. Bhat et al., "ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth," arXiv:2302.12288, 2023.

[3] L. Yang et al., "Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data,"CVPR, 2024.

[4] Z. Lipson et al., "RAFT-Stereo: Multilevel Recurrent Field Transforms for Stereo Matching,"3DV, 2021.

[5] J. Li et al., "Practical Stereo Matching via Cascaded Recurrent Network with Adaptive Correlation,"CVPR, 2022.

[6] C. Godard et al., "Digging into Self-Supervised Monocular Depth Estimation,"ICCV, 2019.

[7] S. Sajjan et al., "ClearGrasp: 3D Shape Estimation of Transparent Objects for Manipulation,"ICRA, 2020.

[8] R. Hartley, A. Zisserman,Multiple View Geometry in Computer Vision, 2nd ed., Cambridge Univ. Press, 2004.

[9] R. Szeliski,Computer Vision: Algorithms and Applications, 2nd ed., Springer, 2022.