TimeSuite: 通过基于 grounding 的调优提升 MLLMs 处理长视频理解能力
计算机视觉与模式识别
2025-02-13 v2 人工智能
多媒体
摘要
多模态大语言模型(MLLMs)在短视频理解方面已显示出惊人的性能。然而,对于长视频理解,MLLMs仍然面临挑战。本文提出TimeSuite,一套新设计,用于适配现有短视频MLLMs以处理长视频理解,包括一种简单且高效的处理长视频序列的框架、一个用于MLLMs grounding 调优的高质量视频数据集,以及一个精心设计的指令调优任务,以在传统QA格式中显式融入grounding监督。具体而言,基于VideoChat,我们提出我们的长视频MLLMs,称为VideoChat-T,通过实现token置换来压缩长视频token,并引入Temporal Adaptive Position Encoding (TAPE) 来增强视觉表征的时间感知能力。同时,我们引入TimePro,一个综合性grounding中心指令调优数据集,包含9项任务和34.9万条高质量grounding标注。值得注意的是,我们设计了一种新的指令调优任务类型,称为Temporal Grounded Caption,用于对视频进行详细描述并预测相应的时间戳。这种显式的时间位置预测将指导MLLMs在生成描述时正确地注意视觉内容,从而减少由LLM导致的幻觉风险。实验结果表明,TimeSuite为增强短视频MLLM的长视频理解能力提供了成功方案,在Egoschema和VideoMME基准测试中分别实现了 和 的提升。此外,VideoChat-T在零样本temporal grounding方面表现出色,显著优于现有最先进的MLLMs。经过fine-tuning后,其性能与传统监督式专家模型持平。
引用
@article{arxiv.2410.19702,
title = {TimeSuite: Improving MLLMs for Long Video Understanding via Grounded Tuning},
author = {Xiangyu Zeng and Kunchang Li and Chenting Wang and Xinhao Li and Tianxiang Jiang and Ziang Yan and Songze Li and Yansong Shi and Zhengrong Yue and Yi Wang and Yali Wang and Yu Qiao and Limin Wang},
journal= {arXiv preprint arXiv:2410.19702},
year = {2025}
}
备注
Accepted by ICLR2025