中文

面向指代表达理解的自步式多粒度跨模态交互建模

计算机视觉与模式识别 2024-03-13 v3

摘要

作为视觉-语言任务中一个重要且具有挑战性的问题,指代表达理解(REC)通常需要大量视觉与语言模态的多粒度信息以实现准确推理。此外,由于视觉场景的多样性和语言表达的变化,一些困难样本比其他样本具有更丰富的多粒度信息。如何聚合来自不同模态的多粒度信息并从困难样本中提取丰富知识,是 REC 任务中的关键。为应对上述挑战,本文提出一种自步式多粒度跨模态交互建模框架,通过网络结构与学习机制的创新提升语言到视觉的定位能力。具体而言,我们设计了一种基于 transformer 的多粒度跨模态注意力,有效利用视觉与语言编码器中固有的多粒度信息。进一步,考虑到样本间差异较大,我们提出自步式样本信息量学习,自适应地增强网络对包含丰富多粒度信息样本的学习。所提框架在 RefCOCO、RefCOCO+、RefCOCOg 和 ReferItGame 等广泛使用的数据集上显著优于当前最优方法,证明了方法的有效性。

关键词

引用

@article{arxiv.2204.09957,
  title  = {Self-paced Multi-grained Cross-modal Interaction Modeling for Referring Expression Comprehension},
  author = {Peihan Miao and Wei Su and Gaoang Wang and Xuewei Li and Xi Li},
  journal= {arXiv preprint arXiv:2204.09957},
  year   = {2024}
}

备注

Accepted by TIP