中文

EDA:用于 3D 视觉定位的显式文本解耦与密集对齐

计算机视觉与模式识别 2023-10-09 v3 机器人学

摘要

3D 视觉定位旨在于点云中找到由富含语义线索的自由形式自然语言描述所提及的物体。然而,现有方法要么提取耦合所有词的句子级特征,要么更关注物体名称,这会丢失词级信息或忽略其他属性。为缓解这些问题,我们提出 EDA,其显式解耦句子中的文本属性,并在此类细粒度语言与点云物体间进行密集对齐。具体而言,我们首先提出文本解耦模块以为每个语义成分生成文本特征。然后,我们设计两个损失来监督两种模态间的密集匹配:位置对齐损失和语义对齐损失。在此基础上,我们进一步引入一项新的视觉定位任务——在无物体名称条件下定位物体,其可全面评估模型的密集对齐能力。通过实验,我们在两个广泛使用的 3D 视觉定位数据集 ScanRefer 和 SR3D/NR3D 上取得了最先进的性能,并在我们新提出的任务上获得绝对领先。源代码见 https://github.com/yanmin-wu/EDA。

关键词

引用

@article{arxiv.2209.14941,
  title  = {EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding},
  author = {Yanmin Wu and Xinhua Cheng and Renrui Zhang and Zesen Cheng and Jian Zhang},
  journal= {arXiv preprint arXiv:2209.14941},
  year   = {2023}
}

备注

CVPR2023, with supplementary material