中文

面向点云三维密集描述的空间性引导 Transformer

计算机视觉与模式识别 2022-04-25 v1

摘要

三维点云中的密集描述是一项新兴的视觉-语言任务,涉及物体级三维场景理解。不同于传统三维目标检测中粗粒度语义类别预测与边界框回归,三维密集描述旨在为场景中每个感兴趣物体生成进一步的、更精细的实例级自然语言描述标签,描述其视觉外观与空间关系。为检测并描述场景中的物体,遵循神经机器翻译的思想,我们提出一种基于 Transformer 的编码器-解码器架构,即 SpaCap3D,将物体转化为描述,其中我们特别研究了三维场景中物体的相对空间性,并通过 token 到 token 的空间关系学习目标设计了空间性引导编码器,以及用于精确且空间性增强的物体描述生成的对象中心解码器。在两个基准数据集 ScanRefer 和 ReferIt3D 上的评估表明,我们提出的 SpaCap3D 在 [email protected] 上分别优于基线方法 Scan2Cap 4.94% 和 9.61%。我们带有源代码和补充文件的项目页面位于 https://SpaCap3D.github.io/ 。

关键词

引用

@article{arxiv.2204.10688,
  title  = {Spatiality-guided Transformer for 3D Dense Captioning on Point Clouds},
  author = {Heng Wang and Chaoyi Zhang and Jianhui Yu and Weidong Cai},
  journal= {arXiv preprint arXiv:2204.10688},
  year   = {2022}
}

备注

IJCAI 2022. Project Page: https://SpaCap3D.github.io/