中文

OpenThinkIMG:通过视觉工具强化学习学习思考

计算机视觉与模式识别 2025-07-10 v2

摘要

虽然人类能够灵活地利用交互式视觉认知来解决复杂问题,但让大型视觉语言模型(LVLMs)能够学习类似的自适应行为以使用视觉工具仍然富有挑战性。一个重要障碍是当前缺乏标准化的基础设施,这阻碍了整合多样工具、生成丰富的交互数据以及有效训练鲁棒的智能体。为此,我们引入 OpenThinkIMG,这是第一个开源、综合性的面向工具增强型 LVLMs 的端到端框架。它具备标准化的视觉工具接口、用于策略初始化的可扩展轨迹生成,以及灵活的训练环境。此外,考虑在静态演示上的监督微调(SFT)对动态工具调用的策略泛化能力有限,我们提出了一种新的强化学习(RL)框架 V-ToolRL,用于训练 LVLMs 以学习调用外部视觉工具的自适应策略。V-ToolRL 使 LVLMs 能够通过直接优化任务成功率来从工具交互中获取反馈,从而自主发现最佳工具使用策略。我们在具有挑战性的图表推理任务上经验性地验证了 V-ToolRL。我们的 RL 训练智能体基于 Qwen2-VL-2B,显著优于其 SFT 初始化的对手(提升 28.83 分),并在平均提升 12.7 分后超越了像 Taco 和 CogCom等已建立的监督工具学习基线。值得注意的是,它还在准确率上超过了像 GPT-4.1 这样的领先闭源模型 8.68 分。我们希望 OpenThinkIMG 能作为推进动态、工具增强型视觉推理、帮助社区发展能够真正“通过图像思考”的 AI 智能体的基础框架。

关键词

引用

@article{arxiv.2505.08617,
  title  = {OpenThinkIMG: Learning to Think with Images via Visual Tool Reinforcement Learning},
  author = {Zhaochen Su and Linjie Li and Mingyang Song and Yunzhuo Hao and Zhengyuan Yang and Jun Zhang and Guanjie Chen and Jiawei Gu and Juntao Li and Xiaoye Qu and Yu Cheng},
  journal= {arXiv preprint arXiv:2505.08617},
  year   = {2025}
}

备注

Work in progress