从工具使用者演进为工具创建者:通过训练-free 经验复用的多模态推理
人工智能
2026-02-03 v1
摘要
现有的工具集成推理(TIR)模型已有效通过整合外部工具扩展了 LLM 的问答能力。然而,现实场景存在诸多开放性问题,其中固定工具往往难以满足任务需求。此外,缺乏自优化机制意味着错误的工具输出可能误导 LLM 的响应。此外,现有工具的构建涉及大量手动工作,从而限制了其适用性。鉴于 LLM 的推理痕迹封装了隐式的问题解决能力,我们提出了 UCT,一种新型训练-free 框架,将 agent 从工具使用者转变为工具创建者。该方法收集推理经验并将其蒸馊为可重用资产。该方法将 agent 从工具使用者转变为工具创建者,实现推理过程中的自适应工具创建和自我更新。我们还引入了记忆整合机制以维护工具库,确保保留的经验记忆在后续推理任务中具有高可重用性。这种新的自动化工具构建范式持续改进工具质量,使整体 agent 系统无需额外训练即可实现进步。广泛实验表明,我们的方法为增强 TIR 模型能力提供了一种新范式。特别是,在跨多域数学和科学推理任务上实现显著性能提升(+20.86% 和 +23.04%),验证了 agent 的自演化能力。
引用
@article{arxiv.2602.01983,
title = {Evolving from Tool User to Creator via Training-Free Experience Reuse in Multimodal Reasoning},
author = {Xintian Shen and Jiawei Chen and Lihao Zheng and Hao Ma and Tao Wei and Kun Zhan},
journal= {arXiv preprint arXiv:2602.01983},
year = {2026}
}