中文

基于多模态大语言模型双向似然估计的文本-视频检索

计算机视觉与模式识别 2025-09-30 v3

摘要

文本-视频检索旨在从大规模在线数据库中,给定一个视频(或文本)查询,找到最相关的文本(或视频)候选。近期的工作利用多模态大语言模型(MLLMs)来改善检索,特别是对于长或复杂的查询-候选对。然而,我们观察到,MLLMs 的朴素应用,即基于候选似然的检索,引入了候选先验偏差,偏向于具有内在更高先验的候选,而非与查询更相关的候选。为此,我们提出了一种新颖的检索框架,基于 MLLM 的双向似然估计(BLiM),它通过训练模型从给定视频生成文本以及从给定文本生成视频特征,从而同时利用查询和候选的似然。此外,我们引入了候选先验归一化(CPN),这是一个简单而有效的免训练分数校准模块,旨在缓解候选似然中的候选先验偏差。在四个文本-视频检索基准上,配备 CPN 的 BLiM 平均在 R@1 上比先前的 SOTA 模型高出 6.4,有效缓解了候选先验偏差并强调了查询-候选相关性。我们对检索之外的各种多模态任务的深入分析突出了 CPN 的广泛适用性,它通过减少对文本先验的依赖来增强视觉理解。代码可在 https://github.com/mlvlab/BLiM 获取。

关键词

引用

@article{arxiv.2507.23284,
  title  = {Bidirectional Likelihood Estimation with Multi-Modal Large Language Models for Text-Video Retrieval},
  author = {Dohwan Ko and Ji Soo Lee and Minhyuk Choi and Zihang Meng and Hyunwoo J. Kim},
  journal= {arXiv preprint arXiv:2507.23284},
  year   = {2025}
}

备注

ICCV 2025 Highlight