中文

LongLLaVA:通过混合架构高效地将多模态 LLM 扩展至 1000 张图像

计算与语言 2025-09-24 v3 人工智能 计算机视觉与模式识别 多媒体

摘要

扩展多模态大语言模型(MLLM)的长上下文能力对于推进视频理解和高分辨率图像分析至关重要。实现这一目标需要在模型架构、数据构建和训练策略上进行系统性改进,特别是为了应对随图像数量增加而导致的性能下降和高计算成本等挑战。在本文中,我们提出了一种融合 Mamba 和 Transformer 模块的混合架构,引入了能够捕捉时间与空间依赖关系的数据构建方法,并采用了渐进式训练策略。我们发布的模型 LongLLaVA(长上下文大语言与视觉助手)在效率与性能之间展现出了有效的平衡。LongLLaVA 在各种基准测试中取得了具有竞争力的结果,同时保持了高吞吐量和低内存消耗。值得注意的是,它能够在单张 A100 80GB GPU 上处理近一千张图像,凸显了其在广泛的多模态应用中的潜力。

关键词

引用

@article{arxiv.2409.02889,
  title  = {LongLLaVA: Scaling Multi-modal LLMs to 1000 Images Efficiently via a Hybrid Architecture},
  author = {Xidong Wang and Dingjie Song and Shunian Chen and Junyin Chen and Zhenyang Cai and Chen Zhang and Lichao Sun and Benyou Wang},
  journal= {arXiv preprint arXiv:2409.02889},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings