Momentor: 推进具有细粒度时间推理能力的视频大语言模型
计算机视觉与模式识别
2024-06-04 v2
摘要
大语言模型在理解和处理基于文本的任务方面表现出卓越的能力。许多努力正在将这些特性迁移到视频模态,这些模型被称为Video-LLM。然而,现有的Video-LLM只能捕获粗粒度语义,无法有效处理与特定视频片段的理解或定位相关的任务。鉴于这些挑战,我们提出了Momentor,一种能够完成细粒度时间理解任务的Video-LLM。为了支持Momentor的训练,我们设计了一个自动数据生成引擎来构建Moment-10M,这是一个包含片段级指令数据的大规模视频指令数据集。我们在Moment-10M上训练Momentor,使其能够执行片段级推理和定位。在多个任务上的零样本评估表明,Momentor在细粒度时间定位的理解和定位方面表现出色。
引用
@article{arxiv.2402.11435,
title = {Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning},
author = {Long Qian and Juncheng Li and Yu Wu and Yaobo Ye and Hao Fei and Tat-Seng Chua and Yueting Zhuang and Siliang Tang},
journal= {arXiv preprint arXiv:2402.11435},
year = {2024}
}
备注
Accepted by ICML 2024