中文

TUN3D:面向未置放图像的真实场景理解

计算机视觉与模式识别 2025-09-29 v1 图像与视频处理

摘要

布局估计和 3D 对象检测是室内场景理解中的两个基本任务。当它们组合在一起时,就可以创建场景的紧凑且语义丰富的空间表示。现有方法通常依赖点云输入,这是一个主要限制,因为大多数消费级相机缺乏深度传感器,而仅使用视觉数据仍远远落后于实际应用。我们提出了 TUN3D,这是首个能够在给定多视角图像输入的情况下解决联合布局估计和 3D 对象检测的问题,无需 ground-truth 相机姿态或深度监督。我们的方法基于轻量级稀疏卷积主干网络,采用两个专用头部:一个用于 3D 对象检测,一个用于布局估计,利用一种新颖且有效的参数化墙面表示。广泛的实验表明,TUN3D 在三个具有挑战性的场景理解基准测试中实现了最先进的性能:(i) 使用 ground-truth 点云,(ii) 使用置放图像,和 (iii) 使用未置放图像。尽管在专门的 3D 对象检测方法上性能持平,TUN3D 显著推进了布局估计,为整体室内场景理解设定了新的基准。代码可在 https://github.com/col14m/tun3d 查看。

关键词

引用

@article{arxiv.2509.21388,
  title  = {TUN3D: Towards Real-World Scene Understanding from Unposed Images},
  author = {Anton Konushin and Nikita Drozdov and Bulat Gabdullin and Alexey Zakharov and Anna Vorontsova and Danila Rukhovich and Maksim Kolodiazhnyi},
  journal= {arXiv preprint arXiv:2509.21388},
  year   = {2025}
}