中文

通过时间门控机制增强视频 LLM 的时序建模

计算机视觉与模式识别 2024-10-10 v1 人工智能 计算与语言 机器学习

摘要

视频大语言模型(Video LLM)在视频问答等视频语言任务方面取得了令人瞩目的成绩。然而,大多数现有 Video LLM 忽略了视频数据中的时序信息,导致在时序感知的视频理解方面受限。为此,我们提出一种 Time Gating Video LLM(TG-Vid),通过 novel Time Gating 模块(TG)来增强时序建模。TG 模块在其子模块上采用时序门控机制,包括时序注意力门控、空间注意力门控和 MLP 门控。该架构使我们模型能够对视频中的时序信息实现稳健的理解。对时序敏感视频基准(即 MVBench、TempCompass 和 NExT-QA)进行广泛评估,表明 TG-Vid 在现有 Video LLM 上显著优于前沿方法。进一步的全面消融实验验证,性能提升归因于 TG 模块的设计。我们的代码已公开于 https://github.com/LaVi-Lab/TG-Vid。

关键词

引用

@article{arxiv.2410.05714,
  title  = {Enhancing Temporal Modeling of Video LLMs via Time Gating},
  author = {Zi-Yuan Hu and Yiwu Zhong and Shijia Huang and Michael R. Lyu and Liwei Wang},
  journal= {arXiv preprint arXiv:2410.05714},
  year   = {2024}
}

备注

EMNLP 2024 Findings (Short)