SDG 合成数据 IADataSDG

合成数据中为何区分多种相机投影?

需要透视、鱼眼大广角或 360° 全景,并关注与实车、实机标定的一致性。

2026-04-09 6 分钟阅读
文章目录9

合成数据中为何区分多种相机投影?

概述

仿真中的「相机」并非单一模型。窄视场透视、车载环视常用的大广角(鱼眼),以及 360° 全景在等距柱状(ERP)上的展开,其几何关系各不相同。在自动驾驶或机器人数据场景中,若投影类型与真实系统不一致,后续的标定、深度估计与训练难以与真机对齐。IADataSDG 可在同一条实时合成管线中按需选用:透视(以内参描述焦距与主点)两种常见鱼眼模型,以及ERP 全景(整圈方向映射为宽约等于高两倍的 2:1 图像)。输出附带投影类型等元信息,便于与实拍数据对照。


背景与意义

实车系统中:前视、侧视多为透视;环视泊车多为鱼眼;舱内或需要全向环境时常采用360° 全景。若合成侧仅支持单一投影,往往只能在透视下强行拉大视场(边缘失真加剧),或与公开数据集、车载标定习惯不一致,影响向真机迁移。


能力范围

  • 透视(针孔模型):以内参(焦距、主点、可选畸变)描述成像,与 KITTI、nuScenes 等常见设定易于对齐;多路相机可分别配置。元数据标明当前投影类型,便于撰写数据集说明与复现实验。
  • 鱼眼:支持车载环视常见的等距等立体两种模型;视场可较大(例如约 170° 及以上)。超广角场景需与引擎侧宽视场策略协同,以保证边缘稳定性。
  • ERP 全景:水平覆盖 360°,映射为2:1矩形图像,与常见全景播放与标注工具的习惯一致。

适用场景

  • 实车多相机标定一致的数据集构建。
  • 环视近距离障碍、路沿等感知任务。
  • 全景语义、视频理解、VLM等依赖全向信息的训练数据。
  • 同一数据集中混用透视、鱼眼与全景(例如单车多传感器)。

与竞品对比(公开能力归纳)

  • CARLA、AirSim:公开资料中长期提供鱼眼与 ERP 采集;多相机以经典透视为主。在「以内参矩阵精细驱动透视相机」方面,公开对比表中常记为不完整或缺失
  • Isaac Sim:鱼眼等能力较强,但在「内参驱动的针孔配置」一项上,公开表多为部分支持。
  • BlenderProc:具备鱼眼等能力,以离线路径追踪为主。
  • IADataSDG:在Unreal Engine 5.7 实时渲染下,将透视、两种鱼眼与 ERP纳入同一系统能力,并与深度、分割等多种输出共享同一几何语境;「三种投影 + 实时 + 多模态」的组合在公开工具中仍相对少见。

不同投影下的模态兼容性

下表与系统说明中的传感器 × 模态矩阵一致(共 13 类视觉相关输出)。鱼眼在常见环视视场(约 170° 以下)下与透视列能力相同;超广鱼眼ERP共用一列限制(由立方体面展开为单张图像时,部分依赖屏幕平面定义的量难以一致定义)。

模态透视鱼眼(常规视场)超广鱼眼 / ERP
RGB
Depth(设备/沿视线方向的深度)
EuclideanDepth(点到相机的直线距离)
DepthFull(含透明等扩展深度)
EuclideanDepthFull
WorldNormal
BaseColor
SemanticSegmentation
InstanceSegmentation
MaterialSegmentation
OpticalFlow(物体)
GlobalOpticalFlow
ObjectEdge
合计13/1313/139/13

补充说明:在全景展开下,若仍将深度理解为普通透视图中沿屏幕向内的距离,将与真实射线方向不一致;物体光流全局光流依赖像素在屏幕上的运动及与上一帧的对齐关系,在整球展开上需额外的球面几何处理,当前版本在上述条目中不予输出,以避免语义误导。RGB、欧氏距离类深度、法线、分割与边缘等仍可用于 360° 相关训练。


工程补充:为什么超广鱼眼 / ERP 少 4 类模态

很多人第一次看到这里,会直觉地觉得:“既然都能做成一张更宽的图,为什么不把所有模态都一起给出来?” 问题恰恰在于,画面虽然还能展开成一张图,但有些量的含义已经变了。

到了超广鱼眼或 ERP,全景图不再只是“视野更大的透视图”。像 RGB、分割、法线、欧氏距离这类沿真实射线去理解的量,仍然说得通;但普通深度和光流更依赖一块固定的成像平面,以及前后两帧在同一投影下的像素对应。画面一旦绕成整圈,这套解释就不再天然成立。

所以 IADataSDG 在这里选择的是更保守的做法:宁可少给 4 类模态,也不交出一批看起来完整、实际上会误导训练的数据。这也是整个系统里一条很重要的取舍原则:能稳定定义的才输出,定义已经摇摆的,就明确说明边界。


在 AI 模型训练中的价值

  • 环视 BEV 感知:BEVFormer、BEVDet 等多相机 BEV 模型在训练时需要与实车布局一致的鱼眼或广角输入;若仿真仅提供透视,模型无法学习桶形畸变下的特征分布,部署到鱼眼硬件时精度衰退。
  • 单目深度估计:Depth Anything、ZoeDepth 等方法对焦距与主点敏感;合成数据以内参驱动相机,可批量生成焦距–深度配对的监督数据,辅助网络泛化到不同镜头规格。
  • 全景理解与 VLM:360° ERP 图像用于 PanoFormer 等全景语义分割,以及视觉–语言模型的全向场景理解;实拍全景标注成本极高,仿真 ERP 输出可作为预训练或数据增强来源。
  • 多视图自监督学习:自监督深度(Monodepth2 系列)与视觉里程计需要多路相机的内外参严格对齐;仿真天然提供无误差标定,可直接用于对极约束损失,而实拍的标定残差往往是训练瓶颈。
  • 视觉导航(VLN):Vision-and-Language Navigation 任务通常需要全景输入与离散视点间的几何关系;ERP + 多投影的组合可直接生成导航训练所需的全向观察与转向后视图。

参考文献

[1] R. Hartley, A. Zisserman,Multiple View Geometry in Computer Vision, 2nd ed., Cambridge Univ. Press, 2004.

[2] J. Kannala, S.S. Brandt, "A Generic Camera Model and Calibration Method for Conventional, Wide-Angle, and Fish-Eye Lenses,"IEEE TPAMI, vol. 28, no. 8, pp. 1335-1340, 2006.

[3] Z. Li et al., "BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers,"ECCV, 2022.

[4] J. Huang et al., "BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View," arXiv:2112.11790, 2021.

[5] L. Yang et al., "Depth Anything: Unleashing the Power of Large-Scale Unlabeled Data,"CVPR, 2024.

[6] C. Godard et al., "Digging into Self-Supervised Monocular Depth Estimation,"ICCV, 2019.

[7] Z. Shen et al., "PanoFormer: Panorama Transformer for Indoor 360° Depth Estimation,"ECCV, 2022.

[8] P. Anderson et al., "Vision-and-Language Navigation: Interpreting Visually-Grounded Navigation Instructions in Real Environments,"CVPR, 2018.