中文

AutoTool:通过解耦熵约束实现RL中工具使用能力的自动扩展

人工智能 2026-03-17 v1

摘要

工具使用代表AI智能体的关键能力,近期进展集中于利用强化学习(RL)来扩展显式推理过程以实现更好性能。然而,当前基于RL的扩展方法在工具使用方面面临一些关键挑战:(a)直接RL训练往往难以充分扩展推理长度以解决复杂问题,(b)扩展后的模型倾向于过度思考简单问题,导致大量令牌效率低下。为了解决这些挑战,我们提出了一种新颖的训练范式,首先采用预训练监督微调帮助模型区分简单和复杂问题,随后通过RL使模型能够自动确定适当的推理轨迹。此外,为了解决自动推理长度扩展问题,我们发现基于熵的优化目标在有效维持模型多样性的同时,成功解锁了模型的扩展能力。基于这一洞察,我们引入了一种基于熵的长短推理融合RL策略。我们在三个基准上的实验表明,模型成功实现了工具使用的高效自动扩展,在减少约81%计算开销的同时取得了显著的9.8%准确率提升。

关键词

引用

@article{arxiv.2603.13348,
  title  = {AutoTool: Automatic Scaling of Tool-Use Capabilities in RL via Decoupled Entropy Constraints},
  author = {Yirong Zeng and Xiao Ding and Yufei Liu and Yuxian Wang and Qunyao Du and Yutai Hou and Wu Ning and Haonan Song and Duyu Tang and Dandan Tu and Bing Qin and Ting Liu},
  journal= {arXiv preprint arXiv:2603.13348},
  year   = {2026}
}

备注

ICLR 2026 poster