通过堆叠时序注意力提升视频- LLM 中的时序理解
计算机视觉与模式识别
2025-10-31 v1
摘要
尽管多模态大型语言模型 (MLLM) 取得了显著进展,但理解视频中复杂时序动态仍是主要挑战。我们的实验表明,当前的视频大型语言模型 (Video-LLM) 架构在时序理解方面存在关键局限,难以处理需要详细理解动作序列和时序进程的任务。在本工作中,我们提出了一种 Video-LLM 架构,在视觉编码器中引入堆叠时序注意力模块。该设计将时序注意力嵌入视觉编码器,使模型能够更好地捕捉动作的进程以及帧之间的关系,从而在将视觉标记传递给 LLM 之前更好地理解时序结构。我们的结果表明,该方法显著提升了时序推理能力,在视频问答任务中超越了现有模型,尤其在动作识别方面表现更佳。我们在包括 VITATECS、MVBench 和 Video-MME 在内的基准测试中取得显著提升,最高可达 +5.5%。通过在视觉编码器中增强时序结构,我们解决了 Video-LLM 中视频理解的关键性差距。项目页面和代码均可在 https://alirasekh.github.io/STAVEQ2/ 提供。
引用
@article{arxiv.2510.26027,
title = {Enhancing Temporal Understanding in Video-LLMs through Stacked Temporal Attention in Vision Encoders},
author = {Ali Rasekh and Erfan Bagheri Soula and Omid Daliran and Simon Gottschalk and Mohsen Fayyaz},
journal= {arXiv preprint arXiv:2510.26027},
year = {2025}
}
备注
Accepted to NeurIPS 2025