中文

MIRe:通过无融合模态交互增强多模态查询表示以实现多模态检索

计算机视觉与模式识别 2025-05-22 v3 人工智能 信息检索 多媒体

摘要

近期多模态检索方法通过利用视觉-文本对齐的预训练策略,赋予基于文本的检索器多模态能力。它们通常在对齐过程中直接融合两种模态以进行交叉引用,从而理解多模态查询。然而,现有方法常因文本主导问题而忽视关键视觉信息,过度依赖文本驱动信号。本文提出 MIRe,一种检索框架,在对齐过程中不融合文本特征即可实现模态交互。我们的方法允许文本查询关注视觉嵌入,同时不将文本驱动信号反馈回视觉表示。此外,我们通过将简洁的问答对转换为扩展段落,构建了用于多模态查询检索的预训练数据集。实验表明,我们的预训练策略显著增强了对多模态查询的理解,在四个多模态检索基准上零样本设置下取得强性能。此外,我们的消融研究和分析明确验证了我们框架在缓解文本主导问题方面的有效性。代码公开可用:https://github.com/yeongjoonJu/MIRe

关键词

引用

@article{arxiv.2411.08334,
  title  = {MIRe: Enhancing Multimodal Queries Representation via Fusion-Free Modality Interaction for Multimodal Retrieval},
  author = {Yeong-Joon Ju and Ho-Joong Kim and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2411.08334},
  year   = {2025}
}

备注

Accepted to ACL 2025 (Findings)