基于生成式多模态大语言模型的通用视频时间定位
计算机视觉与模式识别
2025-11-24 v2
摘要
本文提出一种用于通用视频时间定位的计算模型,能够准确地基于自然语言查询 (如问题或描述) 对视频中的时间片段进行局部化。不同于现有方法仅限于特定视频域或时长的限制,我们提出 UniTime,一种利用生成式多模态大语言模型 (generative Multi-modal Large Language Models, MLLMs) 强大的视觉语言理解能力的通用视频定位模型。我们的模型能够处理多样化的视角、类型和长度的视频,同时理解复杂的语言查询。我们的主要贡献包括:(i)我们考虑对强大 MLLM 进行引导,以实现视频中的时间定位。为实现精确的时间戳输出,我们通过在视频 Token 与时间戳 Token 之间交错插入时间信息来实现。(ii)通过训练模型以适应不同输入粒度的视频 (通过自适应帧缩放),我们的方案能够为短视频和长视频实现稳健的时间定位。(iii)综合实验表明,UniTime 在五个公共视频时间定位基准测试中,以零样本和数据集特定微调两种设置均优于领先的现有方法。(iv)当作为长视频问答 (VideoQA) 的初始时刻检索器使用时,UniTime 可显著提升 VideoQA 的准确率,凸显其在复杂视频理解任务中的价值。
引用
@article{arxiv.2506.18883,
title = {Universal Video Temporal Grounding with Generative Multi-modal Large Language Models},
author = {Zeqian Li and Shangzhe Di and Zhonghua Zhai and Weilin Huang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2506.18883},
year = {2025}
}