中文

为细化视频检索适配多模态大语言模型

计算机视觉与模式识别 2026-05-04 v3 信息检索

摘要

我们的目标是构建一种嵌入模型,能够捕捉搜索查询与候选视频之间的细化关系。我们涵盖了细化检索的三个方面:(i)时间细化,(ii)否定细化,(iii)多模态细化。对于时间细化,我们考虑需要区分时间上相反动作的手性动作,如“打开门”与“关闭门”。对于否定细化,我们考虑包含否定词如“not”、“none”的查询,允许用户指定他们不想要的内容。对于多模态细化,我们考虑由查询组成的视频以及文本编辑指令的联合检索任务。目标是开发一种统一的嵌入模型,有效处理此类细化。为此,我们将一个训练用于生成文本的多模态大语言模型(MLLM)改造为嵌入模型。我们使用精心挑选的硬负样本在文本上进行对比学习微调,以在所学嵌入空间中灌输所需的细化。尽管仅进行文本训练,我们的方法在所有细化视频检索基准测试上实现了最先进的性能。我们还分析了这种改进是如何实现的,表明文本-only训练减少了文本和视频嵌入之间的模态差距,从而实现更好的嵌入空间组织。

关键词

引用

@article{arxiv.2512.13511,
  title  = {Adapting MLLMs for Nuanced Video Retrieval},
  author = {Piyush Bagad and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2512.13511},
  year   = {2026}
}

备注

38 Pages. Project page at http://bpiyush.github.io/tara-website