中文

Visionary-R1:通过强化学习减轻视觉推理中的捷径

星系天体物理 2025-08-04 v2

摘要

学习通用推理能力是人工智能中的一个长期存在的挑战。最近的研究表明,像 DeepSeek-R1 这样的大型语言模型(LLMs)可以通过如 GRPO 这样的强化学习技术,能够使用简单的问答对来发展推理能力。在本文中,我们旨在通过强化学习和视觉问答对,训练视觉语言模型(VLM)在图像数据上执行推理,而无需任何显式的链式思维(CoT)监督。我们的发现表明,仅仅将强化学习应用于 VLM——通过提示模型在提供答案前产生推理链——会导致模型从容易的问题中发展出捷径,从而降低其在未见数据分布上的泛化能力。我们认为,缓解捷径学习的关键在于鼓励模型在推理前解释图像。因此,我们训练模型遵循“描述-推理-回答”输出格式:最初为图像生成详细描述,然后构建广泛的推理链。我们在 273K 条 CoT 免费视觉问答对上进行训练,并仅使用强化学习,我们的模型命名为 Visionary-R1,在多个视觉推理基准测试中超过了像 GPT-4o、Claude3.5-Sonnet 和 Gemini-1.5-Pro 这类强大的多模态模型。

关键词

引用

@article{arxiv.2505.14676,
  title  = {A JWST View of the Overmassive Black Hole in NGC 4486B},
  author = {Behzad Tahmasebzadeh and Matthew A. Taylor and Monica Valluri and Haruka Yoshino and Eugene Vasiliev and Michael J. Drinkwater and Solveig Thompson and Kristen Dage and Patrick Côté and Laura Ferrarese and Tatsuya Akiba and Vivienne Baldassare and Misty C. Bentz and John P. Blakeslee and Holger Baumgardt and Youkyung Ko and Chengze Liu and Ann-Marie Madigan and Eric W. Peng and Joel Roediger and Kaixiang Wang and Tyrone E. Woods},
  journal= {arXiv preprint arXiv:2505.14676},
  year   = {2025}
}

备注

12 pages, 5 figures, 2 tables; accepted by ApJL