Vision-R1:通过视觉引导的强化学习在大型视觉语言模型中实现无人类对齐
计算机视觉与模式识别
2025-03-25 v1 人工智能
摘要
大型视觉语言模型(LVLMs)通常遵循两阶段训练范式——预训练和监督微调。最近,源自语言领域的偏好优化(preference optimization)作为有效的后训练强化策略,旨在增强LVLMs的能力。然而,构建高质量的人类标注偏好数据和开发稳健的奖励模型以模拟这些偏好都是高成本且具有挑战性的。为了这一观察,我们提出Vision-R1,这是一种 novel vision-guided R1-like reinforcement learning algorithm for LVLMs, 通过提供明确的视觉反馈来奖励模型。它仅利用精选指令数据,无需 specialized reward models 和 handcrafted preference datasets。我们采用基于准则的奖励函数,进一步整合多维反馈,以基于视觉任务逻辑全面评估模型完成情况。此外,我们引入一种渐进式规则细化策略,在训练期间动态调整奖励准则,实现持续模型改进并缓解奖励攻击。大量实验表明,使用Vision-R1对7B LVLMs进行微调可实现持续的性能提升,甚至可提升50%,并超过规模为10倍的 state-of-the-art 模型。
引用
@article{arxiv.2503.18013,
title = {Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning},
author = {Yufei Zhan and Yousong Zhu and Shurong Zheng and Hongyin Zhao and Fan Yang and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2503.18013},
year = {2025}
}
备注
Project in development. Github: https://github.com/jefferyZhan/Griffon/tree/master/Vision-R1