中文

ScanEnts3D:利用短语到三维物体的对应关系改进三维场景中的视觉-语言模型

计算机视觉与模式识别 2023-04-04 v2

摘要

ScanRefer [16] 和 ReferIt3D [3] 这两个流行数据集将自然语言与真实世界的三维数据联系起来。在本文中,我们整理了一个大规模且互补的数据集,通过将对齐参考语句中所有提及的物体与其在三维场景中的底层实例,扩展了上述两个数据集。具体而言,我们的三维扫描实体(ScanEnts3D)数据集在 84k 条自然参考语句中提供了跨 705 个真实场景的 369k 个物体之间的显式对应关系。关键的是,我们表明,通过引入能够从这一新数据集中学习的直观损失函数,我们可以显著提升几种近期提出的神经倾听架构的性能,包括在 Nr3D 和 ScanRefer 基准上分别将 SOTA 提升 4.3% 和 5.0%。此外,我们在语言生成任务上试验了具有竞争力的基线和近期方法,并表明与神经倾听者一样,三维神经说话者也能通过用 ScanEnts3D 训练而明显受益,包括在 Nr3D 基准上以 13.2 个 CIDEr 点提升 SOTA。总体而言,我们精心进行的实验研究有力支持如下结论:通过在 ScanEnts3D 上学习,常用的视觉-语言三维架构可以在不需要在测试时提供这些新收集的标注的情况下,于泛化中变得更高效且更具可解释性。项目网页为 https://scanents3d.github.io/。

关键词

引用

@article{arxiv.2212.06250,
  title  = {ScanEnts3D: Exploiting Phrase-to-3D-Object Correspondences for Improved Visio-Linguistic Models in 3D Scenes},
  author = {Ahmed Abdelreheem and Kyle Olszewski and Hsin-Ying Lee and Peter Wonka and Panos Achlioptas},
  journal= {arXiv preprint arXiv:2212.06250},
  year   = {2023}
}

备注

The project's webpage is https://scanents3d.github.io/