LLaVA-OneVision-1.5:面向民主化多模态训练的全开源框架
计算机视觉与模式识别
2025-12-16 v3
摘要
我们提出 LLaVA-OneVision-1.5,这是一套新的大型多模态模型(LMM),实现了与当前最佳水平相当的性能,同时计算和财务成本显著降低。与现有工作不同,LLaVA-OneVision-1.5 提供了一个开放、高效且可复现的框架,用于从零开始构建高质量的视觉语言模型。LLaVA-OneVision-1.5 发行版包括三个主要组件:(1)大规模精选数据集:我们构建了包含 8500 万概念平衡预训练数据集 LLaVA-OneVision-1.5-Mid-Training 和一套精心筛选的包含 2200 万指令数据集 LLaVA-OneVision-1.5-Instruct。(2)高效训练框架:我们开发了一个完整的端到端高效训练框架,利用离线并行数据打包策略,使 LLaVA-OneVision-1.5 可在 16000 美元的预算内进行训练。(3)最先进性能:实验结果表明,LLaVA-OneVision-1.5 在广泛的下游任务上表现出竞争力。具体而言,LLaVA-OneVision-1.5-8B 在 27 个基准测试中的 18 个上超越 Qwen2.5-VL-7B,LLaVA-OneVision-1.5-4B 在所有 27 个基准测试中超越 Qwen2.5-VL-3B。(4)基于 RL 的后训练:我们通过一个轻量级的 RL 阶段释放模型的潜在潜能,有效地激发了强大的链式思考推理能力,显著提升了复杂多模态推理任务的性能。
引用
@article{arxiv.2509.23661,
title = {LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training},
author = {Xiang An and Yin Xie and Kaicheng Yang and Wenkang Zhang and Xiuwei Zhao and Zheng Cheng and Yirui Wang and Songcen Xu and Changrui Chen and Didi Zhu and Chunsheng Wu and Huajie Tan and Chunyuan Li and Jing Yang and Jie Yu and Xiyao Wang and Bin Qin and Yumeng Wang and Zizhen Yan and Ziyong Feng and Ziwei Liu and Bo Li and Jiankang Deng},
journal= {arXiv preprint arXiv:2509.23661},
year = {2025}
}
备注
LLaVA-OneVision-1.5 Technical Report