Vero:通用视觉推理的开源强化学习方案
计算机视觉与模式识别
2026-04-08 v2 人工智能
计算与语言
摘要
构建一个能在图表、科学、空间理解和开放式任务中工作的视觉推理器需要什么?最强的视觉语言模型(VLMs)表明这种广泛的视觉推理触手可及,但其背后的方案仍不清楚——它们被锁定在专有强化学习(RL)流水线和非公开数据中。我们引入Vero,一个完全开源的VLM家族,在多样化的视觉推理任务上匹配或超越了现有开源权重模型。我们在六个广泛的任务类别中扩展RL数据和奖励,构建了Vero-600K——一个来自59个数据集的60万样本数据集,并设计了任务路由奖励来处理异构答案格式。Vero取得了最先进性能,在VeroEval(我们的30个挑战性基准测试套件)上平均提升四个基础模型3.6-5.3分。从Qwen3-VL-8B-Instruct出发,Vero在30个基准测试中的23个上超越了Qwen3-VL-8B-Thinking,而无需额外的专有思维数据。当从同一基础模型训练时,Vero-600K在任务类别上超越了现有的RL数据集。系统性消融实验揭示,不同任务类别引发质上不同的推理模式,这些模式在孤立状态下迁移性差,这表明广泛的数据覆盖是强RL扩展的主要驱动力。所有数据、代码和模型均已发布。
引用
@article{arxiv.2604.04917,
title = {Vero: An Open RL Recipe for General Visual Reasoning},
author = {Gabriel Sarch and Linrong Cai and Qunzhong Wang and Haoyang Wu and Danqi Chen and Zhuang Liu},
journal= {arXiv preprint arXiv:2604.04917},
year = {2026}
}
备注
Project page: https://vero-reasoning.github.io/