中文

Refer-it-in-RGBD:RGBD 图像中三维视觉定位的自底向上方法

计算机视觉与模式识别 2021-03-18 v3

摘要

在 RGBD 图像中定位指称表达式已成为一个新兴领域。我们提出了一种在单视图 RGBD 图像中进行三维视觉定位的新任务,其中被指称的物体常因遮挡而仅被部分扫描。与以往直接在三维场景中生成物体候选框进行定位的工作不同,我们提出了一种自底向上的方法,逐步聚合上下文感知信息,有效应对部分几何结构带来的挑战。我们的方法首先在底层融合语言和视觉特征,生成一张热力图,粗略定位 RGBD 图像中的相关区域。然后,我们的方法基于该热力图进行自适应特征学习,并通过另一次视觉-语言融合进行物体级匹配,最终定位被指称的物体。我们通过在与 ScanRefer 数据集提取的 RGBD 图像以及我们新收集的 SUNRefer 数据集上与最先进(SOTA)方法比较来评估所提方法。实验表明,我们的方法在这两个数据集上均以较大优势([email protected] 提升 11.2% 和 15.6%)超越了先前的方法。

关键词

引用

@article{arxiv.2103.07894,
  title  = {Refer-it-in-RGBD: A Bottom-up Approach for 3D Visual Grounding in RGBD Images},
  author = {Haolin Liu and Anran Lin and Xiaoguang Han and Lei Yang and Yizhou Yu and Shuguang Cui},
  journal= {arXiv preprint arXiv:2103.07894},
  year   = {2021}
}

备注

CVPR 2021, project page: https://unclemedm.github.io/Refer-it-in-RGBD/