中文

CodeV: 基于工具感知策略优化的图像导向代码推理

计算机视觉与模式识别 2026-03-03 v2

摘要

智能体式视觉语言模型正不断训练以"通过调用图像操作来思考图像"。然而,我们发现高最终答案准确率常常掩盖了非忠实的视觉推理:模型可能在无关区域调用工具,或完全忽略工具输出,却仍能猜出正确答案。本文首先提出一种忠诚度评估协议,用于衡量中间视觉工具输出(如裁剪)是否实际包含所查询的证据。这揭示了最近的视觉智能体在视觉搜索基准测试中实现了高最终答案准确率,但 exhibits低忠实度工具使用率。随后,我们引入CodeV,通过工具感知策略优化(TAPO)训练的基于代码的视觉智能体。TAPO是一种基于过程级强化学习框架,将GRPO增强为在视觉工具输入和输出上定义的稠密奖励,而非链式思考标记,这样监督更易验证且不易受奖励黑客攻击。CodeV将视觉工具表示为可执行的Python代码,TAPO仅依据问题和工具输出对步骤奖励进行赋值,鼓励必要且以证据为导向的工具使用。在两阶段的SFT+RL管道中,CodeV在相关视觉搜索基准测试中实现了与竞争模型相当或更好的准确率,同时大幅提升了忠实度工具使用率。除了视觉搜索,CodeV在多模态推理和数学基准测试中也取得了强性能,表明对中间工具行为进行显式监督是构建可信赖、智能体式视觉推理系统的关键。

关键词

引用

@article{arxiv.2511.19661,
  title  = {CodeV: Code with Images for Faithful Visual Reasoning via Tool-Aware Policy Optimization},
  author = {Xinhai Hou and Shaoyuan Xu and Manan Biyani and Moyan Li and Jia Liu and Todd C. Hollon and Bryan Wang},
  journal= {arXiv preprint arXiv:2511.19661},
  year   = {2026}
}