Eagle 2.5:提升面向前沿视觉语言模型的长上下文后训练
计算机视觉与模式识别
2025-04-22 v1
摘要
我们介绍Eagle 2.5,一套面向长上下文多模态学习的前沿视觉语言模型 (VLM)。我们的工作解决了长视频理解和高分辨率图像理解中的挑战,提出了一种通用的框架用于两者。所提出的训练框架包含自动降采样和图像面积保持两个技术,旨在保持上下文的完整性和视觉细节。该框架还包括长上下文数据训练中大量的效率优化。最后,我们提出了Eagle-Video-110K数据集,集成了story-level和clip-level标注,促进了长视频理解。Eagle 2.5在长上下文多模态基准测试上实现了显著的改进,为解决现有VLM的局限性提供了稳健的解决方案。值得注意的是,我们最佳模型Eagle 2.5-8B在512输入帧下实现72.4%的Video-MME得分,匹配了顶级商业模型如GPT-4o和大规模开源模型如Qwen2.5-VL-72B和InternVL2.5-78B的结果。
引用
@article{arxiv.2504.15271,
title = {Eagle 2.5: Boosting Long-Context Post-Training for Frontier Vision-Language Models},
author = {Guo Chen and Zhiqi Li and Shihao Wang and Jindong Jiang and Yicheng Liu and Lidong Lu and De-An Huang and Wonmin Byeon and Matthieu Le and Tuomas Rintamaki and Tyler Poon and Max Ehrlich and Tuomas Rintamaki and Tyler Poon and Tong Lu and Limin Wang and Bryan Catanzaro and Jan Kautz and Andrew Tao and Zhiding Yu and Guilin Liu},
journal= {arXiv preprint arXiv:2504.15271},
year = {2025}
}