TimeMarker:用于长短视频理解的通用视频-LLM,具备卓越的时间局部化能力
计算机视觉与模式识别
2024-11-28 v1 人工智能
摘要
大型语言模型(LLM)的快速发展显著推进了多模态大型语言模型(LMM),尤其是在视觉语言任务方面。然而,现有的视频语言模型往往忽视精确的时间局部化,难以处理长度不同的视频。我们引入TimeMarker,一个专为视频内容优化的通用视频-LLM,强调时间局部化。TimeMarker集成了时间分隔符标记(Temporal Separator Tokens),以增强时间感知,准确标记视频中的特定时刻。它采用AnyLength机制进行动态帧采样和自适应token合并,有效处理短视频和长视频。此外,TimeMarker利用多样化数据集,包括进一步转换的时序相关视频问答数据集,以强化其时间理解能力。还采用图像和交错数据进一步提升模型的语义感知能力。评估表明,TimeMarker在多个基准测试中实现了最先进的性能,在短视频和长视频类别中均表现卓越。我们的项目页面位于\url{https://github.com/TimeMarker-LLM/TimeMarker/}。
引用
@article{arxiv.2411.18211,
title = {TimeMarker: A Versatile Video-LLM for Long and Short Video Understanding with Superior Temporal Localization Ability},
author = {Shimin Chen and Xiaohan Lan and Yitian Yuan and Zequn Jie and Lin Ma},
journal= {arXiv preprint arXiv:2411.18211},
year = {2024}
}