LongVILA: 用于长视频的长上下文视觉语言模型扩展
计算机视觉与模式识别
2024-12-16 v6 计算与语言
摘要
长上下文能力对多模态基础模型至关重要,尤其是对长视频理解。我们提出了 LongVILA,这是一个通过算法与系统协同设计的长上下文视觉语言模型的完整解决方案。在模型训练方面,我们通过引入两个额外阶段——长上下文扩展和长视频监督微调——升级了现有的视觉语言模型以支持长视频理解。然而,长视频的训练在计算和内存方面都非常密集。我们提出了长上下文多模态序列并行(MM-SP)系统,能够高效地对长视频训练和推理进行并行化,在 256 个 GPU 上实现 2M 上下文长度的训练,无需任何梯度检查点。LongVILA 高效地将 VILA 的视频帧数从 8 扩展到 2048,在 6000 帧(超过 100 万个 token)视频 needle-in-a-haystack 任务中实现了 99.8% 的准确率。LongVILA-7B 在 9 个热门视频基准测试上表现出强劲准确率,例如在带字幕的 VideoMME 上达到 65.1%。此外,MM-SP 比环形风格序列并行快 2.1–5.7 倍,比混合上下文和张量并行的 Megatron 快 1.1–1.4 倍。此外,它与 Hugging Face Transformers 无缝集成。
引用
@article{arxiv.2408.10188,
title = {LongVILA: Scaling Long-Context Visual Language Models for Long Videos},
author = {Yukang Chen and Fuzhao Xue and Dacheng Li and Qinghao Hu and Ligeng Zhu and Xiuyu Li and Yunhao Fang and Haotian Tang and Shang Yang and Zhijian Liu and Ethan He and Hongxu Yin and Pavlo Molchanov and Jan Kautz and Linxi Fan and Yuke Zhu and Yao Lu and Song Han},
journal= {arXiv preprint arXiv:2408.10188},
year = {2024}
}
备注
Code and models are available at https://github.com/NVlabs/VILA/tree/main/longvila