中文

AdaReasoner:用于迭代视觉推理的动态工具编排

人工智能 2026-01-29 v2 计算与语言 计算机视觉与模式识别 多智能体系统

摘要

当人类面临超出其即时能力的问题时,他们会依赖工具,这为改进多模态大语言模型(MLLMs)中的视觉推理提供了一个有前景的范式。因此,有效的推理取决于知道使用哪些工具、何时调用它们以及如何在多个步骤中组合它们,即使在面对新工具或新任务时也是如此。我们引入了 \textbf{AdaReasoner},这是一系列将工具使用作为通用推理技能而非特定工具或显式监督行为来学习的多模态模型。AdaReasoner 的实现得益于 (i) 一个可扩展的数据策划管道,使模型接触到长时序、多步骤的工具交互;(ii) Tool-GRPO,一种基于终端任务成功来优化工具选择和排序的强化学习算法;以及 (iii) 一种动态调节工具使用的自适应学习机制。这些组件共同允许模型从任务上下文和中间结果推断工具效用,从而实现多工具协调和对未见工具的泛化。从经验上看,AdaReasoner 表现出强大的工具自适应和泛化行为:它自主采用有益的工具,抑制无关工具,并根据任务需求调整工具使用频率,尽管从未受过明确的训练来这样做。这些能力转化为在具有挑战性的基准测试上的 SOTA 性能,使 7B 基础模型平均提升 +24.9\%,并在包括 VSP 和 Jigsaw 在内的多项任务上超越了 GPT-5 等强大的专有系统。

关键词

引用

@article{arxiv.2601.18631,
  title  = {AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning},
  author = {Mingyang Song and Haoyu Sun and Jiawei Gu and Linjie Li and Luxin Xu and Ranjay Krishna and Yu Cheng},
  journal= {arXiv preprint arXiv:2601.18631},
  year   = {2026}
}

备注

28 pages, 10 figures and 13 tables