VideoLLM 懂得何时发声:通过视频文本双人谱互动格式提升时间敏感视频理解
计算机视觉与模式识别
2025-11-25 v2 计算与语言
摘要
最近的研究主要关注视频大型语言模型(VideoLLM)的模型架构和训练数据集,较少探讨用户与模型之间交互格式。在现有工作中,用户通常通过 entire video 和 query 作为输入与 VideoLLM 交互,模型 then 生成 response。这种交互格式限制了 VideoLLM 在直播理解等场景的应用,因为视频不会结束且需要实时响应;也导致在需要局部化视频片段的时间敏感任务上表现不佳。本文关注视频文本双人谱互动格式。该格式特点是视频连续播放,用户和模型可以在视频播放的任何位置插入文本消息。当文本消息结束时,视频继续播放,类似于两个演员在双人谱中的交替表演。我们构建 MMDuetIT,一个为适应视频文本双人谱互动格式而设计的视频文本训练数据集。我们还引入了多答案 grounding 视频问答(MAGQA)任务,以衡量 VideoLLM 的实时响应能力。在 MMDuetIT 上训练的 MMDuet 显示,采用视频文本双人谱互动格式后,模型在各种时间敏感任务上均实现显著提升(YouCook2 密集视频字幕中 CIDEr 达 76%,QVHighlights 高亮检测中 mAP 达 90%,Charades-STA 时间视频定位中 [email protected] 提升 25%),且几乎不增加训练 effort,同时也使 VideoLLM 能够以实时方式回复视频播放过程。
引用
@article{arxiv.2411.17991,
title = {VideoLLM Knows When to Speak: Enhancing Time-Sensitive Video Comprehension with Video-Text Duet Interaction Format},
author = {Yueqian Wang and Xiaojun Meng and Yuxuan Wang and Jianxin Liang and Jiansheng Wei and Huishuai Zhang and Dongyan Zhao},
journal= {arXiv preprint arXiv:2411.17991},
year = {2025}
}
备注
9 pages