MVAM:用于细粒度图文匹配的多视图注意力方法
计算机视觉与模式识别
2025-02-20 v2 计算与语言
摘要
现有的双流模型(如 CLIP)通过独立的表示对图像和文本进行编码,在确保检索速度的同时表现出良好的性能,引起了业界和学界的关注。然而,单一表示往往难以充分捕捉复杂内容。此类模型在匹配过程中可能会忽略细粒度信息,导致检索结果次优。为了克服这一局限性并提升双流模型的性能,我们提出了一种用于图文匹配的多视图注意力方法(MVAM)。该方法利用具有独特视图代码的多样化注意力头来学习图像和文本的多种表示,然后将这些表示拼接起来进行匹配。我们还引入了一个多样性目标,以明确鼓励注意力头关注输入数据的不同方面,从而捕捉互补的细粒度细节。这种多样性使模型能够从多个角度表示图文对,确保对关键内容有更全面的理解和对齐。我们的方法允许模型从不同视角编码图像和文本并关注更关键的细节,从而实现更好的匹配性能。我们在 MSCOCO 和 Flickr30K 上的实验表明,该方法优于现有模型,进一步的案例研究揭示,不同的注意力头可以关注不同的内容,从而实现更全面的表示。
引用
@article{arxiv.2402.17237,
title = {MVAM: Multi-View Attention Method for Fine-grained Image-Text Matching},
author = {Wanqing Cui and Rui Cheng and Jiafeng Guo and Xueqi Cheng},
journal= {arXiv preprint arXiv:2402.17237},
year = {2025}
}
备注
Published as a conference paper at ECIR 2025