中文

PreFLMR:扩展细粒度晚期交互多模态检索器

计算与语言 2024-06-06 v2

摘要

大型多模态模型 (LMMs) 在自然语言和视觉理解方面表现出色,但在诸如基于知识的视觉问答 (KB-VQA) 等要求严苛的任务中面临挑战,这些任务涉及从文档集合中检索相关信息以用于构建问题答案。我们提出了一个广泛的训练与评估框架 M2KR,用于 KB-VQA。M2KR 包含一系列视觉和语言任务,我们将其整合为一套基准任务套件,用于训练和评估通用多模态检索器。我们利用 M2KR 开发了 PreFLMR,这是最近开发的用于 KB-VQA 的细粒度晚期交互多模态检索器 (FLMR) 方法的预训练版本,并报告了在一系列任务上的最新 State-of-the-Art 结果。我们还展示了针对 PreFLMR 缩放行为的研究,旨在对未来通用多模态检索器的发展有所帮助。

关键词

引用

@article{arxiv.2402.08327,
  title  = {PreFLMR: Scaling Up Fine-Grained Late-Interaction Multi-modal Retrievers},
  author = {Weizhe Lin and Jingbiao Mei and Jinghong Chen and Bill Byrne},
  journal= {arXiv preprint arXiv:2402.08327},
  year   = {2024}
}

备注

ACL 2024; Project page: https://preflmr.github.io/