TemporalVLM: 用于长视频中时间推理的视频大语言模型
计算机视觉与模式识别
2026-04-21 v6
摘要
我们提出 TemporalVLM,这是一个用于时间推理和细粒度理解的视频大语言模型(video LLM)。我们的方法包括一种视觉编码器,用于将长视频映射为具有时序感知性并包含局部与全局线索的特征。它首先将输入视频划分为短期片段,这些片段结合时间戳记一起编码,并通过重叠的时间窗口进行融合,以生成时序敏感的局部特征。随后,局部特征通过双向长短期记忆(BiLSTM)模块进行全局特征聚合。此外,为促进 TemporalVLM 的评估,我们构建了一个大规模长视频数据集——IndustryASM(行业装配过程),该数据集包含来自工厂车间录制的视频,由工业工程师标注动作和时间戳,以用于时间和运动分析以及时间动作分割评估。最终,大量实验表明,TemporalVLM 在时间推理和细粒度理解任务上超越了先前方法,包括密集视频描述、时间视频定位、视频高亮检测和时间动作分割。就我们目前所知,本工作是首次将 LSTM 引入视频大语言模型。
引用
@article{arxiv.2412.02930,
title = {TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos},
author = {Fawad Javed Fateh and Umer Ahmed and Hamza Khan and M. Zeeshan Zia and Quoc-Huy Tran},
journal= {arXiv preprint arXiv:2412.02930},
year = {2026}
}
备注
Accepted to ACL 2026