中文

基于离线多模态大语言模型的零样态视频时刻检索

多媒体 2025-01-15 v1 计算机视觉与模式识别

摘要

视频时刻检索(VMR)的目标是预测给定语言查询在视频中语义匹配的时段。现有基于多模态大语言模型(MLLM)的VMR方法过度依赖高质量数据集和耗时的微调。尽管近期研究引入了零样态设置以避免微调,但忽略了查询中固有的语言偏差,导致错误的局部化。在面对上述挑战时,本文提出了Moment-GPT,一个针对零样态VMR的无调参管道,利用冻结的MLLM。具体而言,我们首先采用LLaMA-3纠正和重述查询,以缓解语言偏差。随后,我们设计一个跨度生成器结合MiniGPT-v2产生适应性候选跨度。最后,为充分利用MLLM的视频理解能力,我们应用VideoChatGPT和跨度评分器来选择最合适的跨度。我们的方法在多个公开数据集上显著优于最先进的MLLM-based和零样态模型,包括QVHighlights、ActivityNet-Captions和Charades-STA。

关键词

引用

@article{arxiv.2501.07972,
  title  = {Zero-shot Video Moment Retrieval via Off-the-shelf Multimodal Large Language Models},
  author = {Yifang Xu and Yunzhuo Sun and Benxiang Zhai and Ming Li and Wenxin Liang and Yang Li and Sidan Du},
  journal= {arXiv preprint arXiv:2501.07972},
  year   = {2025}
}

备注

Accepted by AAAI 2025