中文

基于多模态条件适应的视觉 grounding

计算机视觉与模式识别 2024-09-10 v1 多媒体

摘要

视觉 grounding 是在图像中定位由自然语言表达式指定的物体的任务。现有方法通常将通用目标检测框架扩展以解决此任务,分别使用独立的视觉编码器和文本编码器提取视觉特征和文本特征,然后在多模态解码器中融合这些特征以进行最终预测。然而,视觉 grounding 存在独特挑战。它通常涉及在同一图像中定位具有不同文本描述的物体。现有方法因独立的视觉编码器对同一图像会产生相同的视觉特征,从而限制了检测性能。近期方法提出了各种语言引导的视觉编码器以解决此问题,但大多依赖于文本信息且需要复杂的设计。本文引入多模态条件适应 (MMCA),使视觉编码器能够适应性地更新权重,将注意力引向与文本相关的区域。具体而言,我们首先集成不同模态的信息以获得多模态嵌入。然后我们利用一组权重系数,这些系数由多模态嵌入生成,用于重新组织权重更新矩阵并应用于视觉 grounding 模型的视觉编码器。在四个广泛使用的数据集上进行大量实验表明,MMCA 显著性地提高了性能并实现了最新的结果。消融实验进一步证明了该方法的轻量级和高效。我们的源代码可在 https://github.com/Mr-Bigworth/MMCA 查阅。

关键词

引用

@article{arxiv.2409.04999,
  title  = {Visual Grounding with Multi-modal Conditional Adaptation},
  author = {Ruilin Yao and Shengwu Xiong and Yichen Zhao and Yi Rong},
  journal= {arXiv preprint arXiv:2409.04999},
  year   = {2024}
}

备注

Accepted by ACM MM 2024 [Oral]