中文

PanoContext-Former:基于 Transformer 的全景场景整体理解

计算机视觉与模式识别 2023-06-06 v2

摘要

全景图像能够更深入地理解并更整体地感知 360360^\circ 周围环境,与标准透视图像相比,可自然编码更丰富的场景上下文信息。先前的工作以自下而上的形式解决场景理解任务,因而各子任务被分别处理,该过程中很少探索相关性。本文提出一种利用深度先验进行整体室内场景理解的新方法,从单张全景图中同时恢复物体形状、有向包围盒以及 3D 房间布局。为充分利用丰富的上下文信息,我们设计了一个基于 transformer 的上下文模块来预测场景各组成部分的表示与关系。此外,我们引入了一个用于场景理解的真实世界数据集,包含照片级真实感全景图、高保真深度图像、精确标注的房间布局,以及有向物体包围盒与形状。在合成与真实世界数据集上的实验表明,我们的方法在布局估计与 3D 物体检测方面均优于先前全景场景理解方法。

关键词

引用

@article{arxiv.2305.12497,
  title  = {PanoContext-Former: Panoramic Total Scene Understanding with a Transformer},
  author = {Yuan Dong and Chuan Fang and Liefeng Bo and Zilong Dong and Ping Tan},
  journal= {arXiv preprint arXiv:2305.12497},
  year   = {2023}
}