Ovis2.5 技术报告
计算机视觉与模式识别
2025-08-19 v1 人工智能
计算与语言
机器学习
摘要
我们提出了 Ovis2.5,这是 Ovis2 的后继版本,旨在实现原生分辨率的视觉感知和强大的多模态推理能力。Ovis2.5 集成了处理原生可变分辨率图像的原生分辨率视觉转换器,避免了固定分辨率瓷砖导致的细节降解,既保留细微细节又保持全局布局——这对视觉密集型内容(如复杂图表)至关重要。为强化推理能力,我们训练模型超越线性链式思考,执行反思——包括自我检查和修订。这种先进能力在推理时以可选的"思考模式"形式暴露,允许用户在延迟与准确性之间进行权衡。模型通过五阶段综合课程进行训练,逐步构建其技能。该过程从基础视觉和多模态预训练开始,随后进行大规模指令调优,最终通过 DPO 和 GRPO 实现对齐和推理增强。为高效实现这些升级,我们采用多模态数据打包和混合并行,实现了显著的端到端加速。我们发布了两个开源模型:Ovis2.5-9B 和 Ovis2.5-2B。后者延续了"小模型,高性能"的哲学,适用于资源受限的本地场景。在 OpenCompass 多模态排行榜上,Ovis2.5-9B 平均得分为 78.3,显著优于其前身 Ovis2-8B,实现了参数范围在亚 40B 之内的开源 MLLM 中的最先进成绩;Ovis2.5-2B 的得分为 73.9,树立了该规模的 SOTA。除了整体得分外,Ovis2.5 在 STEM 基准测试中取得领先成绩,展现出在 grounding 和视频任务方面的强大能力,并在复杂图表分析方面实现了开源 SOTA。
关键词
引用
@article{arxiv.2508.11737,
title = {Ovis2.5 Technical Report},
author = {Shiyin Lu and Yang Li and Yu Xia and Yuwei Hu and Shanshan Zhao and Yanqing Ma and Zhichao Wei and Yinglun Li and Lunhao Duan and Jianshan Zhao and Yuxuan Han and Haijun Li and Wanying Chen and Junke Tang and Chengkun Hou and Zhixing Du and Tianli Zhou and Wenjie Zhang and Huping Ding and Jiahe Li and Wen Li and Gui Hu and Yiliang Gu and Siran Yang and Jiamang Wang and Hailong Sun and Yibo Wang and Hui Sun and Jinlong Huang and Yuping He and Shengze Shi and Weihong Zhang and Guodong Zheng and Junpeng Jiang and Sensen Gao and Yi-Feng Wu and Sijia Chen and Yuhui Chen and Qing-Guo Chen and Zhao Xu and Weihua Luo and Kaifu Zhang},
journal= {arXiv preprint arXiv:2508.11737},
year = {2025}
}