中文

通过工具监督强化学习实现视觉推理

计算机视觉与模式识别 2026-04-23 v1

摘要

本文研究多模态大语言模型如何有效掌握工具使用以解决复杂视觉推理任务的问题。为此,我们提出了一种新颖的工具监督强化学习框架,通过直接的工具监督实现更有效的工具使用学习。我们关注一系列简单、原生且可解释的视觉工具,包括放大、旋转、翻转和画点/线,其工具监督易于收集。我们开发了一种强化学习课程,第一阶段仅由一组具有充分动机的特定工具奖励进行优化,第二阶段在允许调用工具的同时以准确性为目标的奖励进行训练。通过这种方式,模型在使用工具完成视觉推理任务之前先掌握工具调用能力,避免了这些异构任务之间潜在的优化冲突。我们的实验表明,工具监督课程训练是高效的,且 ToolsRL 能够在复杂视觉推理任务中实现强大的工具使用能力。

关键词

引用

@article{arxiv.2604.19945,
  title  = {Visual Reasoning through Tool-supervised Reinforcement Learning},
  author = {Qihua Dong and Gozde Sahin and Pei Wang and Zhaowei Cai and Robik Shrestha and Hao Yang and Davide Modolo},
  journal= {arXiv preprint arXiv:2604.19945},
  year   = {2026}
}

备注

Accepted to CVPR 2026 Findings. 17 pages