中文

SLQ:通过冻结 MLLM 实现基于共享潜在查询的跨模态检索

计算机视觉与模式识别 2026-05-12 v3

摘要

多模态大语言模型 (MLLM) 具备内在的推理与世界知识能力,但将其用于密集检索仍富有挑战性。现有方法依赖激进的参数更新(如完整微调或 LoRA),可能破坏预训练语义空间,损害推理所必需的结构化知识。为此,我们提出 SLQ,一种参数高效的调优框架,在保持主干网络完全冻结的情况下将 MLLM 适用于检索任务。SLQ 引入一小组共享潜在查询 (Shared Latent Queries), appended 到文本和图像标记中,利用模型的原生因果注意力机制将多模态上下文聚合到统一的嵌入空间。此外,为更好地评估检索(超越表面模式匹配),我们构建了 KARR-Bench,一个旨在实现知识感知检索的基准。大量实验表明,SLQ 在 COCO 和 Flickr30K 上超越完整微调和 LoRA,在 MMEB 上表现可比,并在 KARR-Bench 上实现显著提升,验证了通过非侵入式适配保留预训练表征是 MLLM 检索的有效策略。代码已公开:https://github.com/CnFaker/SLQ。

关键词

引用

@article{arxiv.2604.13710,
  title  = {SLQ: Bridging Modalities via Shared Latent Queries for Retrieval with Frozen MLLMs},
  author = {Haoran Lou and Ziyan Liu and Chunxiao Fan and Yuexin Wu and Yue Ming and Hao Wu and Kai Zuo and Yibo Chen and Xu Tang},
  journal= {arXiv preprint arXiv:2604.13710},
  year   = {2026}
}

备注

Accepted to ICML-2026