统一视频语言模型的专用视觉编码器
计算机视觉与模式识别
2025-06-17 v2 计算与语言
机器学习
摘要
近年来,大语言模型(LLM)的兴起为视频领域带来了强大的推理能力,催生了视频大语言模型(VideoLLM)。然而,VideoLLM目前依赖单一视觉编码器处理所有视觉信息,限制了可传递给LLM的视觉信息量和类型。我们提出的方法MERV(Multi-Encoder Representation of Videos),采用多个冻结视觉编码器为视频创建统一表示,为VideoLLM提供全面的专用视觉知识。通过对各编码器特征的时空对齐,我们能够解决更广泛的开放式和多选题视频理解任务,并超越 prior SOTA。在标准视频理解基准测试中,MERV在Video-LLaVA上提升了最高3.7%的准确率,Video-ChatGPT得分亦显著提升。我们还将SeViLA(在零样本感知测试中取得最佳成绩的模型)提升了2.2%。MERV引入的额外参数极少,训练速度也快于等效的单编码器方法,同时实现了视觉处理的并行化。我们还提供定性证据表明,MERV成功捕获了各编码器所具备的领域知识。我们的结果为利用多个视觉编码器实现综合视频理解指明了有前景的方向。
引用
@article{arxiv.2501.01426,
title = {Unifying Specialized Visual Encoders for Video Language Models},
author = {Jihoon Chung and Tyler Zhu and Max Gonzalez Saez-Diez and Juan Carlos Niebles and Honglu Zhou and Olga Russakovsky},
journal= {arXiv preprint arXiv:2501.01426},
year = {2025}
}
备注
Accepted to ICML 2025 as a Poster. Project page: https://tylerzhu.com/merv/