有效训练长上下文视觉语言模型:超越128K上下文的泛化
计算机视觉与模式识别
2026-05-14 v1
摘要
长上下文建模正在成为现代大型视觉语言模型(LVLMs)的核心能力,使其能够在文档理解、视频分析和多轮工具使用等agentic工作流程中维持上下文。然而,实际的训练配方仍不够探索,尤其是设计和平衡长上下文数据混合方面。在本工作中,我们系统研究了LVLMs的长上下文继续预训练,将7B模型的上下文从32K扩展至128K,并进行大量消融实验。我们首先表明,长文档VQA远比OCR转录更有效。基于此观察,我们的消融实验进一步得出三项关键发现:i) 在序列长度分布方面,平衡数据优于以目标长度为中心的数据(如128K),这表明长上下文能力需要在各种长度和位置上实现通用的关键信息检索;ii) 检索仍是主要瓶颈,倾向于使用检索密集型数据混合搭配适度的推理数据以实现任务多样性;iii) 纯长文档VQA基本保留短上下文能力,这表明指令格式的长数据减少了短数据混合的需求。基于这些发现,我们引入MMProLong,通过仅用5B token的预算,对Qwen2.5-VL-7B进行长上下文继续预训练。MMProLong在长文档VQA得分上提升7.1%,并在256K和512K上下文中保持强大性能,超出了128K训练窗口,无需额外训练。它进一步泛化到网页基于的多模态针头检索、长上下文视觉文本压缩和长视频理解,无需任务特定监督。总体而言,我们的研究建立了实用的LongPT配方和经验基础,为推动长上下文视觉语言模型提供了支撑。
引用
@article{arxiv.2605.13831,
title = {Training Long-Context Vision-Language Models Effectively with Generalization Beyond 128K Context},
author = {Zhaowei Wang and Lishu Luo and Haodong Duan and Weiwei Liu and Sijin Wu and Ji Luo and Shen Yan and Shuai Peng and Sihang Yuan and Chaoyi Huang and Yi Lin and Yangqiu Song},
journal= {arXiv preprint arXiv:2605.13831},
year = {2026}
}
备注
work in progress