中文

TransRefer3D:用于细粒度三维视觉定位的实体与关系感知 Transformer

计算机视觉与模式识别 2021-08-12 v2 人工智能

摘要

近来提出的细粒度三维视觉定位是一项关键且具有挑战性的任务,其目标是从同类别的其他干扰物体中识别出由自然语言句子所指的三维物体。现有工作通常采用动态图网络间接建模模态内/间交互,由于视觉与语言内容的整体化表示,模型难以将所指物体与干扰物区分。本工作中,我们利用 Transformer 对置换不变的三维点云数据的天然适用性,提出 TransRefer3D 网络以提取物体间实体与关系感知的多模态上下文,从而实现更具判别力的特征学习。具体而言,我们设计了实体感知注意力(EA)模块与关系感知注意力(RA)模块来进行细粒度跨模态特征匹配。在协同注意力操作辅助下,我们的 EA 模块将视觉实体特征与语言实体特征匹配,而 RA 模块将成对视觉关系特征与语言关系特征匹配。我们进一步将 EA 与 RA 模块整合为实体与关系感知上下文块(ERCB),并堆叠若干 ERCB 构成我们的 TransRefer3D 以进行层次化多模态上下文建模。在 Nr3D 与 Sr3D 数据集上的大量实验表明,我们所提模型以最高 10.6% 的优势显著超越现有方法,并达到新的 SOTA。据我们所知,这是首个探究 Transformer 架构用于细粒度三维视觉定位任务的工作。

关键词

引用

@article{arxiv.2108.02388,
  title  = {TransRefer3D: Entity-and-Relation Aware Transformer for Fine-Grained 3D Visual Grounding},
  author = {Dailan He and Yusheng Zhao and Junyu Luo and Tianrui Hui and Shaofei Huang and Aixi Zhang and Si Liu},
  journal= {arXiv preprint arXiv:2108.02388},
  year   = {2021}
}

备注

ACM MM2021