中文

生成式跨模态检索:在多模态语言模型中记忆图像以用于检索及其他任务

多媒体 2024-02-19 v1 人工智能 计算与语言 计算机视觉与模式识别 信息检索

摘要

生成式语言模型的最新进展展示了其从文档中记忆知识并召回知识以有效响应用户查询的能力。基于此能力,我们提出使多模态大语言模型(MLLMs)能够在其参数中记忆并召回图像。给定针对视觉内容的用户查询,预期 MLLM 能从其参数中“召回”相关图像作为响应。实现这一目标面临显著挑战,包括 MLLMs 内建的视觉记忆与视觉召回机制。为应对这些挑战,我们引入了一种生成式跨模态检索框架,该框架分配唯一的标识符字符串来表示图像,并涉及两个训练步骤:学习记忆与学习检索。第一步专注于训练 MLLM 记忆图像与其各自标识符之间的关联;第二步则教导 MLLM 在给定文本查询输入时生成目标图像对应的标识符。通过在 MLLMs 中记忆图像,我们引入了一种区别于以往判别式方法的跨模态检索新范式。实验表明,即使在大规模图像候选集下,该生成式范式也能有效且高效地运行。

关键词

引用

@article{arxiv.2402.10805,
  title  = {Generative Cross-Modal Retrieval: Memorizing Images in Multimodal Language Models for Retrieval and Beyond},
  author = {Yongqi Li and Wenjie Wang and Leigang Qu and Liqiang Nie and Wenjie Li and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2402.10805},
  year   = {2024}
}