面向大型视觉语言模型视频理解的时序导向配方
计算机视觉与模式识别
2025-05-20 v1
摘要
近年来,大型视觉语言模型(LVM)取得了显著进展。为解决视频理解问题,它们依赖其隐式的时序理解能力,从而未能揭示贡献时序理解能力的关键组件,可能限制了这些LVM在视频理解中的潜力。本文开展了彻底的实证研究,解密影响LVM时序理解的关键组件。我们的实证研究表明,显著影响集中在视觉编码器与大语言模型之间的中间接口。基于这些见解,我们提出了时序导向的配方,包括时序导向的训练方案和放大的接口。我们开发的模型显著提升了在标准视频理解任务上的性能。
引用
@article{arxiv.2505.12605,
title = {Temporal-Oriented Recipe for Transferring Large Vision-Language Model to Video Understanding},
author = {Thong Nguyen and Zhiyuan Hu and Xu Lin and Cong-Duy Nguyen and See-Kiong Ng and Luu Anh Tuan},
journal= {arXiv preprint arXiv:2505.12605},
year = {2025}
}
备注
In Progress