中文

MARVEL:通过视觉模块插件释放稠密检索的多模态能力

信息检索 2024-06-18 v5

摘要

本文提出通过视觉模块插件的多模态检索模型(MARVEL),其为查询与多模态文档学习一个嵌入空间以进行检索。MARVEL 使用统一的编码器模型对查询和多模态文档进行编码,有助于缓解图像与文本之间的模态鸿沟。具体而言,我们通过将视觉模块编码的图像特征作为其输入,赋予经过充分训练的稠密检索器 T5-ANCE 以图像理解能力。为促进多模态检索任务,我们基于 ClueWeb22 数据集构建了 ClueWeb22-MM 数据集,该数据集将锚文本视为查询,并从锚链接的网页中提取相关的文本与图像文档。我们的实验表明,MARVEL 在多模态检索数据集 WebQA 和 ClueWeb22-MM 上显著优于最先进的方法。MARVEL 为将文本检索的优势拓展至多模态场景提供了契机。此外,我们还展示了语言模型具备提取图像语义并将图像特征部分映射到输入词嵌入空间的能力。所有代码可在 https://github.com/OpenMatch/MARVEL 获取。

关键词

引用

@article{arxiv.2310.14037,
  title  = {MARVEL: Unlocking the Multi-Modal Capability of Dense Retrieval via Visual Module Plugin},
  author = {Tianshuo Zhou and Sen Mei and Xinze Li and Zhenghao Liu and Chenyan Xiong and Zhiyuan Liu and Yu Gu and Ge Yu},
  journal= {arXiv preprint arXiv:2310.14037},
  year   = {2024}
}