中文

UniCoRN:结合大型多模态模型的统一注释检索网络

计算机视觉与模式识别 2025-02-13 v1

摘要

多模态检索方法在处理需要同时推理查询和检索实体的视觉内容的复杂组合查询时存在局限性。另一方面,大型多模态模型 (LMMs) 可以用语言回答更复杂的视觉问题,但缺乏检索相关实体来支持其回答的固有能力。我们旨在通过 UniCoRN——一个统一注释检索网络——来解决这些局限性,该网络结合了组合多模态检索方法和生成式语言方法的优势,超越了检索增强生成 (RAG)。我们引入了一个实体适配器模块,将检索到的多模态实体重新注入 LMM,使其在生成答案和注释时能够关注它们。通过保持基础 LMM 冻结,UniCoRN 在保留其原始能力的同时,能够在单一集成框架下执行检索和文本生成任务。为评估这些新能力,我们引入了注释检索任务 (CoR) 及相应的数据集,目标是从图像中检索出准确回答给定问题的图像,并生成额外的文本响应以提供关于视觉信息的进一步澄清和细节。我们在多个数据集上展示了 UniCoRN 的有效性,在组合多模态检索上相比最先进方法实现了 +4.5% 的召回率提升,在 CoR 的注释任务上相比 RAG 实现了 +14.9% 的 METEOR 和 +18.4% 的 BEM 提升。

关键词

引用

@article{arxiv.2502.08254,
  title  = {UniCoRN: Unified Commented Retrieval Network with LMMs},
  author = {Maximilian Jaritz and Matthieu Guillaumin and Sabine Sternig and Loris Bazzani},
  journal= {arXiv preprint arXiv:2502.08254},
  year   = {2025}
}