视觉工具使用强化学习到底学到了什么?离析工具诱导效应与内在效应以处理作物-放大
计算机视觉与模式识别
2026-05-22 v2
摘要
视觉工具使用强化学习(RL)可为视觉语言模型赋予视觉算子如作物-放大,实现显著性能提升,但目前仍不清楚这些提升是由工具使用的改进还是内在能力的演进驱动。我们引入MED(Measure--Explain--Diagnose),一个从粗到细的框架,用于离析内在能力变化与工具诱导效应, 将工具诱导的性能差异分解为增益与损害术语,并探究其演化机制的驱动因素。在作物-放大情境下的多个检查点级分析中,针对两种不同工具先验的两个视觉语言模型和六个基准,我们发现改进主要来自内在学习,而工具使用RL主要减少工具诱导的损害(例如更少的调用相关错误和较弱的工具模式干扰),而在纠正内在故障的基于工具的纠正方面仅有限地推进。总体而言,在本研究中研究的作物-放大情境下,当前的视觉工具使用RL学习如何与工具安全共存,而非真正掌握它们。
引用
@article{arxiv.2602.01334,
title = {What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom},
author = {Yan Ma and Weiyu Zhang and Tianle Li and Linge Du and Xuyang Shen and Pengfei Liu},
journal= {arXiv preprint arXiv:2602.01334},
year = {2026}
}
备注
ICML 2026 camera ready. Code: https://github.com/GAIR-NLP/Med