中文

ODIN:用于2D和3D分割的统一模型

计算机视觉与模式识别 2024-06-27 v3 人工智能 机器学习 机器人学

摘要

在当代3D分割基准(如ScanNet)上,最先进的模型消费并标注数据集提供的3D点云,这些点云是通过对感知的多视图RGB-D图像进行后处理获得的。它们通常在领域内训练,放弃了大规模2D预训练,并且优于替代方法(即对带姿态的RGB-D多视图图像进行特征化)。消费带姿态图像的方法与消费后处理3D点云的方法之间的性能差距,助长了2D和3D感知需要不同模型架构的观点。在本文中,我们挑战这一观点,并提出了ODIN(全维度实例分割),一个能够分割和标注2D RGB图像和3D点云的模型,使用一种在2D视图内和3D跨视图信息融合之间交替的Transformer架构。我们的模型通过所涉及令牌的位置编码来区分2D和3D特征操作,这些编码捕获2D补丁令牌的像素坐标和3D特征令牌的3D坐标。ODIN在ScanNet200、Matterport3D和AI2THOR 3D实例分割基准上取得了最先进的性能,在ScanNet、S3DIS和COCO上取得了有竞争力的性能。当使用感知的3D点云代替从3D网格采样的点云时,它以较大优势优于所有先前的工作。当用作可指令具身代理架构中的3D感知引擎时,它在TEACh动作-对话基准上创造了新的最先进水平。我们的代码和检查点可在项目网站(https://odin-seg.github.io)找到。

关键词

引用

@article{arxiv.2401.02416,
  title  = {ODIN: A Single Model for 2D and 3D Segmentation},
  author = {Ayush Jain and Pushkal Katara and Nikolaos Gkanatsios and Adam W. Harley and Gabriel Sarch and Kriti Aggarwal and Vishrav Chaudhary and Katerina Fragkiadaki},
  journal= {arXiv preprint arXiv:2401.02416},
  year   = {2024}
}

备注

Camera Ready (CVPR 2024, Highlight)