一种视觉三元统一强化学习
计算机视觉与模式识别
2026-04-17 v3 计算与语言
摘要
强化学习 (RL) 正成为后训练视觉语言模型 (VLM) 的重要方向,但公共训练方法对于统一的多模态RL仍不成熟,尤其是针对异构推理和感知密集型任务。我们提出V-Triune,一种视觉三元统一强化学习方法,用于统一的多模态RL。该方法围绕三个协调的抽象进行组织训练:Sample-Level奖励路由、Verifier-Level结果验证和Source-Level诊断。在该方法中,Dynamic IoU提供特定于局部化的奖励塑形,既避免了宽阈下的奖励歧义,又避免了严格阈值下的奖励稀疏。基于V-Triune,我们开发了Orsta (7B, 32B),一组在八个推理和感知任务上联合训练的模型。在匹配的预算下,统一训练与专家混合方法相当或更好。最终的Orsta模型在MEGA-Bench上超越其 backbone,在强大的多任务RL-VLM基线方面表现出色,并将这些收益 transferred 到广泛的下游基准。这表明统一的RL可以提高单个VLM RL管道中的推理和感知能力。V-Triune系统以及Orsta模型已在 https://github.com/MiniMax-AI/One-RL-to-See-Them-All 上公开。
引用
@article{arxiv.2505.18129,
title = {One RL to See Them All: Visual Triple Unified Reinforcement Learning},
author = {Yan Ma and Linge Du and Xuyang Shen and Shaoxiang Chen and Pengfei Li and Qibing Ren and Lizhuang Ma and Yuchao Dai and Pengfei Liu and Junjie Yan},
journal= {arXiv preprint arXiv:2505.18129},
year = {2026}
}
备注
Technical Report