重新思考熵在大语言模型智能体工具使用行为优化中的作用
人工智能
2026-03-25 v3 软件工程
摘要
基于大语言模型(LLM)的工具使用智能体在数学推理和多跳问答等任务中表现出色。然而,在长轨迹中,智能体经常触发过多且低质量的工具调用,增加了延迟并降低了推理性能,使得管理工具使用行为变得具有挑战性。在这项工作中,我们进行了基于熵的初步实验,并观察到熵的降低与高质量工具调用之间存在强烈的正相关关系。基于这一发现,我们提出将熵降低作为监督信号,并设计了两种奖励策略来满足优化工具使用行为的不同需求。稀疏的结果奖励提供粗略的、轨迹级别的指导以提高效率,而密集的过程奖励则提供细粒度的监督以提升性能。跨多个领域的实验表明,这两种奖励设计都改善了工具使用行为:前者相比基线平均值将工具调用减少了72.07%,而后者将性能提升了22.27%。这些结果将熵降低定位为增强工具使用行为的关键机制,使智能体在现实应用中更具适应性。
引用
@article{arxiv.2602.02050,
title = {Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents},
author = {Zeping Li and Hongru Wang and Yiwen Zhao and Guanhua Chen and Yixia Li and Keyang Chen and Yixin Cao and Guangnan Ye and Hongfeng Chai and Zhenfei Yin},
journal= {arXiv preprint arXiv:2602.02050},
year = {2026}
}