面向点云中物体定位的自由形式描述引导三维视觉图网络
计算机视觉与模式识别
2021-03-31 v1
摘要
三维物体定位旨在基于自由形式的语言描述,在原始点云场景中定位最相关的目标物体。由于点点云的不规则与稀疏特性,理解复杂多样的描述并直接将其提升到点云中是一个新颖且富有挑战性的课题。三维物体定位存在三个主要挑战:在复杂多样的描述中找出主要焦点;理解点云场景;以及定位目标物体。本文针对这三个挑战逐一解决。首先,我们提出一个语言场景图模块以捕获丰富的结构与长距离短语关联。其次,我们引入一个多级三维候选关系图模块来提取物体-物体与物体-场景的共现关系,并增强初始候选的视觉特征。最后,我们设计了一个描述引导的三维视觉图模块,通过节点匹配策略对短语与候选的全局上下文进行编码。在具有挑战性的基准数据集(ScanRefer 和 Nr3D)上的大量实验表明,我们的算法优于现有的最优方法。我们的代码可在 https://github.com/PNXD/FFL-3DOG 获取。
引用
@article{arxiv.2103.16381,
title = {Free-form Description Guided 3D Visual Graph Network for Object Grounding in Point Cloud},
author = {Mingtao Feng and Zhen Li and Qi Li and Liang Zhang and XiangDong Zhang and Guangming Zhu and Hui Zhang and Yaonan Wang and Ajmal Mian},
journal= {arXiv preprint arXiv:2103.16381},
year = {2021}
}