Skywork-R1V3 技术报告
计算与语言
2025-07-11 v3 计算机视觉与模式识别
摘要
我们介绍 Skywork-R1V3,这是一个先进的开源视觉语言模型(VLM),其关键创新在于有效地将文本-only 大语言模型(LLM)中的推理能力迁移到视觉任务。Skywork-R1V3 的强大性能主要源于我们精心设计的 post-training 强化学习框架,该框架无需额外的持续预训练即可有效激活和提升模型的推理能力。通过该框架,我们进一步发现了连接模块在实现多模态推理模型稳健跨模态对齐中的根本作用。此外,我们引入了一种独特的推理能力指标——关键推理 token 的熵,这在 RL 训练中的 checkpoint 选择方面被证明 highly effective。Skywork-R1V3 在 MMMU 上的结果实现了最先进水平,从 64.3% 提升至 76.0%,这一性能匹配了初级人类的能力。值得注意的是,我们的 RL-powered post-training 方法使得 38B 参数模型也能与顶级封闭源 VLM 一路称呼。我们的实现成功地将数学推理转移到其他学科相关推理任务。我们还包括了课程学习和强化微调策略的分析,以及关于多模态推理的更广泛讨论。Skywork-R1V3 代表了多模态推理的重大进步,展示了 RL 作为推动开源 VLM 能力进步的强大引擎。
引用
@article{arxiv.2507.06167,
title = {Skywork-R1V3 Technical Report},
author = {Wei Shen and Jiangbo Pei and Yi Peng and Xuchen Song and Yang Liu and Jian Peng and Haofeng Sun and Yunzhuo Hao and Peiyu Wang and Jianhao Zhang and Yahui Zhou},
journal= {arXiv preprint arXiv:2507.06167},
year = {2025}
}