中文

3DRot:重新发现基于 RGB 的 3D 增强缺失的原始要素

计算机视觉与模式识别 2026-02-17 v3 机器学习 机器人学

摘要

基于 RGB 的 3D 任务(例如 3D 检测、深度估计、3D 关键点估计)仍因标注稀缺、昂贵且增强工具箱薄弱而受限,因为许多图像变换(包括旋转和扭曲)会破坏几何一致性。虽然水平翻转和颜色抖动已成为标准,但严格的 3D 旋转增强在 RGB 管道中却意外地缺席了,主要是由于误以为需要场景深度或场景重建。在本文中,我们引入 3DRot,这是一个即插即用的数据增强方法,通过围绕相机光心旋转和镜像图像,同时同步更新 RGB 图像、相机内参、物体姿态和 3D 标注,以保持投影几何,从而在不依赖任何场景深度的情况下实现几何一致的旋转和反射。我们首先在经典的 RGB 基于 3D 任务——单目 3D 检测上验证了 3DRot。在 SUN RGB-D 上,将 3DRot 插入冻结的 DINO-X + Cube R-CNN 管道后,IoU3DIoU_{3D} 从 43.21 提升至 44.51,旋转误差(ROT)从 22.9122.91^\circ 降至 20.9320.93^\circmAP0.5mAP_{0.5} 从 35.70 提升至 38.11;在跨域 IN10 数据集上也出现较小但持续的提升。除了单目检测之外,在标准 BTS 数据增强方案之上添加 3DRot 进一步提高了 NYU Depth v2 在 abs-rel(从 0.1783 提升至 0.1685)和 δ<1.25\delta<1.25(从 0.7472 提升至 0.7548)中的性能,并降低了 SUN RGB-D 上的跨数据集误差。在 KITTI 上,应用相同的相机中心旋转到 MVX-Net(激光雷达+RGB)中,将中等等级 3D AP 从约 63.85 提升至 65.16,同时与标准 3D 数据增强保持兼容。

关键词

引用

@article{arxiv.2508.01423,
  title  = {3DRot: Rediscovering the Missing Primitive for RGB-Based 3D Augmentation},
  author = {Shitian Yang and Deyu Li and Xiaoke Jiang and Lei Zhang},
  journal= {arXiv preprint arXiv:2508.01423},
  year   = {2026}
}