用于 3D 视觉定位的多视角 Transformer
计算机视觉与模式识别
2022-04-06 v1 计算与语言
摘要
3D 视觉定位任务旨在将自然语言描述定位到 3D 场景中的目标物体,该场景通常以 3D 点云表示。先前的工作在特定视角下研究视觉定位。以此方式学习的视觉-语言对应关系一旦视角改变便容易失效。在本文中,我们提出了一种用于 3D 视觉定位的多视角 Transformer (MVT)。我们将 3D 场景投影到多视角空间,其中 3D 场景在不同视角下的位置信息被同时建模并聚合在一起。多视角空间使网络能够学习更鲁棒的用于 3D 视觉定位的多模态表示,并消除对特定视角的依赖。大量实验表明,我们的方法显著优于所有最先进的方法。具体而言,在 Nr3D 和 Sr3D 数据集上,我们的方法分别比最佳竞争者高出 11.2% 和 7.1%,甚至比近期带有额外 2D 辅助的工作分别高出 5.9% 和 6.6%。我们的代码可在 https://github.com/sega-hsj/MVT-3DVG 获取。
引用
@article{arxiv.2204.02174,
title = {Multi-View Transformer for 3D Visual Grounding},
author = {Shijia Huang and Yilun Chen and Jiaya Jia and Liwei Wang},
journal= {arXiv preprint arXiv:2204.02174},
year = {2022}
}
备注
cvpr2022