通过时间门控机制增强视频 LLM 的时序建模
计算机视觉与模式识别
2024-10-10 v1 人工智能
计算与语言
机器学习
摘要
视频大语言模型(Video LLM)在视频问答等视频语言任务方面取得了令人瞩目的成绩。然而,大多数现有 Video LLM 忽略了视频数据中的时序信息,导致在时序感知的视频理解方面受限。为此,我们提出一种 Time Gating Video LLM(TG-Vid),通过 novel Time Gating 模块(TG)来增强时序建模。TG 模块在其子模块上采用时序门控机制,包括时序注意力门控、空间注意力门控和 MLP 门控。该架构使我们模型能够对视频中的时序信息实现稳健的理解。对时序敏感视频基准(即 MVBench、TempCompass 和 NExT-QA)进行广泛评估,表明 TG-Vid 在现有 Video LLM 上显著优于前沿方法。进一步的全面消融实验验证,性能提升归因于 TG 模块的设计。我们的代码已公开于 https://github.com/LaVi-Lab/TG-Vid。
引用
@article{arxiv.2410.05714,
title = {Enhancing Temporal Modeling of Video LLMs via Time Gating},
author = {Zi-Yuan Hu and Yiwu Zhong and Shijia Huang and Michael R. Lyu and Liwei Wang},
journal= {arXiv preprint arXiv:2410.05714},
year = {2024}
}
备注
EMNLP 2024 Findings (Short)