VTool-R1:通过多模态工具使用的强化学习使 VLM 学会用图像思考
机器学习
2026-03-06 v4 人工智能
摘要
强化学习微调(RFT)通过实现长思维链、自我纠正和有效的工具使用,显著提升了大型语言模型(LLM)的推理能力。虽然最近的工作试图将 RFT 扩展到视觉语言模型(VLM),但这些努力主要产生基于静态图像输入的纯文本推理,未能实现响应中真正的多模态推理。相比之下,Visual Sketchpad 等测试时方法虽然包含了视觉步骤,但缺乏训练机制。我们引入了 VTool-R1,这是第一个通过交错文本和中间视觉推理步骤来训练 VLM 生成多模态思维链的框架。VTool-R1 将基于 Python 的视觉编辑工具集成到 RFT 过程中,使 VLM 能够学习何时以及如何生成有益于最终推理的视觉推理步骤。通过与任务准确率相关的基于结果的奖励进行训练,我们的方法在不依赖基于过程的监督的情况下,激发了用于推理的策略性视觉工具使用。在图表和表格上的结构化视觉问答实验表明,VTool-R1 通过教导 VLM “用图像思考”并使用工具生成多模态思维链,提升了推理性能。为了支持多轮多模态推理的未来研究,我们在 https://github.com/VTOOL-R1/vtool-r1 开源了我们的代码。
引用
@article{arxiv.2505.19255,
title = {VTool-R1: VLMs Learn to Think with Images via Reinforcement Learning on Multimodal Tool Use},
author = {Mingyuan Wu and Jingcheng Yang and Jize Jiang and Meitang Li and Kaizhuo Yan and Hanchao Yu and Minjia Zhang and Chengxiang Zhai and Klara Nahrstedt},
journal= {arXiv preprint arXiv:2505.19255},
year = {2026}
}
备注
ICLR 2026