中文

Act Wisely:在代理式多模态模型中培育元认知工具使用

计算机视觉与模式识别 2026-04-10 v1 人工智能

摘要

代理式多模态模型的出现使系统能够主动与外部环境交互。然而,当前的代理模型存在显著的元认知缺陷:它们难以在利用内部知识和查询外部工具之间进行权衡。因此,他们常常会陷入盲目的工具调用,倾向于即使查询可以从原始视觉上下文中解决时,仍进行本能的工具执行。这会导致严重的延迟瓶颈,并引入额外的噪声,破坏正确的推理。现有的强化学习协议通过对工具使用进行标量化奖励来缓解这一问题,但这种耦合的形式制造了一个不可调和的优化困境:过激的惩罚抑制了必要的工具使用,而温和的惩罚在优势归一化中被准确性奖励的方差完全吞噬,无法有效对抗工具的滥用。为超越这一瓶颈,我们提出了 HDPO,一个将工具效率从竞争性标量目标重新框定为严格条件性目标的框架。通过放弃奖励标量化,HDPO保持两个正交的优化通道:一个最大化任务正确性的准确性通道,另一个在准确轨迹中仅执行经济性约束的效率通道。这种解耦的架构自然地引导代理首先掌握任务解决,然后再精炼其自我依赖。广泛的评估表明,我们得到的模型 Metis 在工具调用次数上降低了数量级,同时提升了推理准确性。

关键词

引用

@article{arxiv.2604.08545,
  title  = {Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models},
  author = {Shilin Yan and Jintao Tong and Hongwei Xue and Xiaojun Tang and Yangyang Wang and Kunyu Shi and Guannan Zhang and Ruixuan Li and Yixiong Zou},
  journal= {arXiv preprint arXiv:2604.08545},
  year   = {2026}
}

备注

Project Page: https://Accio-Lab.github.io/Metis