SAIL-VL2技术报告
计算机视觉与模式识别
2025-09-22 v2
摘要
我们介绍SAIL-VL2,一个开放套件视觉语言基础模型(LVM),用于全面多模态理解与推理。作为SAIL-VL的继承者,SAIL-VL2在多样化图像和视频基准测试中以2B和8B规模实现最先进性能,展现了从细粒度感知到复杂推理的强大能力。其有效性源于三项核心创新。首先,大规模数据策划管道包含评分和过滤策略,提升了captioning、OCR、QA和视频数据中的质量与分布,提高了训练效率。其次,渐进式训练框架从强大的预训练视觉编码器(SAIL-ViT)开始,经历多模态预训练,最终达到思考-融合SFT-RL混合范式,系统性强化模型能力。第三,架构创新超越稠密LLM,延伸至高效稀疏Mixture-of-Experts(MoE)设计。通过这些贡献,SAIL-VL2在106个数据集上表现竞争,在挑战性推理基准如MMMU和MathVista上实现最先进结果。此外,在OpenCompass榜单上,SAIL-VL2-2B在4B规模以下官方发布的开源模型中名列前茅,同时为开源多模态社区提供高效可扩展的基础模型。
引用
@article{arxiv.2509.14033,
title = {SAIL-VL2 Technical Report},
author = {Weijie Yin and Yongjie Ye and Fangxun Shu and Yue Liao and Zijian Kang and Hongyuan Dong and Haiyang Yu and Dingkang Yang and Jiacong Wang and Han Wang and Wenzhuo Liu and Xiao Liang and Shuicheng Yan and Chao Feng},
journal= {arXiv preprint arXiv:2509.14033},
year = {2025}
}
备注
Technical Report