中文

弥合模态差距:面向图像-文本匹配的维度信息对齐与稀疏空间约束

计算机视觉与模式识别 2024-10-23 v1 信息检索

摘要

许多基于对比学习的模型在图像-文本匹配任务中取得了先进性能。这些模型的关键在于分析图像-文本对之间的相关性,这涉及对应维度中嵌入向量的跨模态交互。然而,不同模态的嵌入向量来自不同的模型或模块,存在显著的模态差距。直接交互此类嵌入向量缺乏合理性,可能捕获不准确的相关性。因此,我们提出了一种名为DIAS的新方法,从两个方面弥合模态差距:(1) 我们对齐不同模态嵌入向量在对应维度上的信息表示,以确保相关性计算基于相似信息的交互。(2) 引入模态间和模态内不匹配对的空间约束,以确保模型语义对齐的有效性。此外,提出了一种稀疏相关算法来选择强相关的空间关系,使模型能够学习更显著的特征,并避免被弱相关性误导。大量实验证明了DIAS的优越性,在Flickr30k和MSCOCO基准测试上实现了4.3%-10.2%的rSum提升。

关键词

引用

@article{arxiv.2410.16853,
  title  = {Bridging the Modality Gap: Dimension Information Alignment and Sparse Spatial Constraint for Image-Text Matching},
  author = {Xiang Ma and Xuemei Li and Lexin Fang and Caiming Zhang},
  journal= {arXiv preprint arXiv:2410.16853},
  year   = {2024}
}