中文

VoxFormer:基于稀疏体素 Transformer 的相机三维语义场景补全

计算机视觉与模式识别 2023-03-28 v2 人工智能 机器学习 机器人学

摘要

人类可以轻松想象被遮挡物体和场景的完整 3D 几何结构。这种吸引人的能力对于识别和理解至关重要。为使 AI 系统具备此种能力,我们提出 VoxFormer,一种基于 Transformer 的语义场景补全框架,仅从 2D 图像即可输出完整的 3D 体积语义。我们的框架采用两阶段设计:从深度估计得到的一组稀疏可见且被占据的体素查询开始,随后是通过稠密化阶段从稀疏体素生成密集 3D 体素。该设计的一个关键理念是,2D 图像上的视觉特征仅对应于可见场景结构而非被遮挡或空白区域。因此,从可见结构的特征提取与预测入手更为可靠。一旦获得稀疏查询集合,我们应用掩码自编码器设计,通过自注意力将信息传播至所有体素。在 SemanticKITTI 上的实验表明,VoxFormer 优于当前最优方法,几何相对提升 20.0%、语义相对提升 18.1%,并将训练时 GPU 内存降至低于 16GB。我们的代码发布于 https://github.com/NVlabs/VoxFormer。

关键词

引用

@article{arxiv.2302.12251,
  title  = {VoxFormer: Sparse Voxel Transformer for Camera-based 3D Semantic Scene Completion},
  author = {Yiming Li and Zhiding Yu and Christopher Choy and Chaowei Xiao and Jose M. Alvarez and Sanja Fidler and Chen Feng and Anima Anandkumar},
  journal= {arXiv preprint arXiv:2302.12251},
  year   = {2023}
}

备注

CVPR 2023 Highlight (10% of accepted papers, 2.5% of submissions)