插值式 Video-LLM: 训练自由视野下延长序列 LMM 的方法
计算机视觉与模式识别
2024-10-03 v2 人工智能
机器学习
摘要
大语言模型 (LLM) 的进展催生了多种将视频模态集成到 LLM 中的策略。关键做法是 Video-LLM,通过可优化的接口将高级视频编码器与 LLM 连接。然而,由于计算和数据限制,这些 Video-LLM 通常仅预训练处理短视频,限制了其在更广泛应用中理解长视频内容的能力。此外,微调 Video-LLM 以处理更长视频的成本又高昂。因此,探索在完全训练自由设置下对 Video-LLM 进行插值的需求日益迫切。本文首先识别了在插值 Video-LLM 过程中面临的主要挑战:1) 视频编码器和模态对齐投影器固定,无法将额外帧集成到 Video-LLM 中;2) LLM 主干模型在内容长度方面受限,使处理更多视频 token 变得复杂。为此,我们提出一种用于 Video-LLM 的特定 INTerPolation 方法 (INTP-Video-LLM)。我们引入一种替代视频 token 重排技术,规避固定视频编码器和对齐投影器的限制;此外,我们提出一种训练自由的 LLM 上下文窗口扩展方法,使 Video-LLM 能够理解相应增加的视觉 token。
引用
@article{arxiv.2409.12963,
title = {Interpolating Video-LLMs: Toward Longer-sequence LMMs in a Training-free Manner},
author = {Yuzhang Shang and Bingxin Xu and Weitai Kang and Mu Cai and Yuheng Li and Zehao Wen and Zhen Dong and Kurt Keutzer and Yong Jae Lee and Yan Yan},
journal= {arXiv preprint arXiv:2409.12963},
year = {2024}
}