中文

Scan2Cap:RGB-D 扫描中基于上下文的密集描述

计算机视觉与模式识别 2020-12-07 v1 机器学习 图像与视频处理

摘要

我们提出了基于消费级 RGB-D 传感器的三维扫描密集描述任务。作为输入,我们假设给定三维场景的点云;期望输出是边界框以及底层物体的描述。为解决三维物体检测与描述问题,我们提出 Scan2Cap,一种端到端训练的方法,用于检测输入场景中的物体并用自然语言描述它们。我们采用注意力机制,在生成描述词元的同时参考局部上下文中的相关成分。为在生成的描述标题中反映物体关系(即相对空间关系),我们使用消息传递图模块来促进物体关系特征的学习。我们的方法能够有效定位并描述 ScanRefer 数据集中场景的三维物体,以显著优势(27.61% [email protected] 提升)超越二维基线方法。

关键词

引用

@article{arxiv.2012.02206,
  title  = {Scan2Cap: Context-aware Dense Captioning in RGB-D Scans},
  author = {Dave Zhenyu Chen and Ali Gholami and Matthias Nießner and Angel X. Chang},
  journal= {arXiv preprint arXiv:2012.02206},
  year   = {2020}
}

备注

Video: https://youtu.be/AgmIpDbwTCY