更少的标记与更少的视频:扩展大型视觉语言模型的视频理解能力
计算机视觉与模式识别
2024-06-13 v1 人工智能
摘要
在图像基准大型视觉语言模型(image-LVLM)取得进展的同时,向视频模型(video-LVLM)的转型受限于高质量视频数据的可得性所限。本文通过利用图像与视频之间的视觉共性,高效地将image-LVLMs 演进为video-LVLMs 以解决这一挑战。我们提出了一种成本效益高的video-LVLM,通过增强模型架构、引入创新的训练策略,并识别出最有效的视频指令数据类型。我们创新的加权标记抽样器显著压缩了每个视频帧的视觉标记数量,从而有效降低了计算成本。我们也发现,仅使用先前video-LVLMs 的10%视频数据,就能在各种训练阶段获得令人印象深刻的结果。此外,我们深入研究了在资源有限的setting 中,视频指令数据对模型性能的影响,突显了纳入强调时间理解的视频训练数据对提升模型性能的重要性。所得的更少标记和更少视频的LVLM(FTFV-LVLM)在视频和图像基准测试中表现出卓越的性能,验证了我们的模型设计和训练方法。
引用
@article{arxiv.2406.08024,
title = {Fewer Tokens and Fewer Videos: Extending Video Understanding Abilities in Large Vision-Language Models},
author = {Shimin Chen and Yitian Yuan and Shaoxiang Chen and Zequn Jie and Lin Ma},
journal= {arXiv preprint arXiv:2406.08024},
year = {2024}
}