利用不确定性:基于熵调制的长期程度LLM代理策略梯度
机器学习
2025-09-12 v1 计算与语言
摘要
在长期程度任务中,基于大语言模型(LLM)的代理面临一个显著挑战:稀疏的、基于结果的奖励难以为中间步骤分配信用。以往方法主要关注通过传统强化学习技术(如逆强化学习)或使用过程奖励模型(PRM)来创建稠密奖励信号以指导学习。在本文中,我们识别出LLM学习动力学中的一个根本性问题:策略梯度的大小本质上与熵相关,这导致对确定性正确动作的更新不够高效,同时可能 destabilize 不确定动作的大幅更新。为解决此问题,我们提出熵调制策略梯度(EMPG)框架,根据每一步的不确定性和最终任务结果重新校准学习信号。EMPG 放大确定性正确动作的更新,惩罚确定性错误的更新,并削弱不确定步骤的更新,以稳定探索。我们进一步引入了未来清晰度的奖励项,以鼓励代理找到更可预测的解决方案路径。通过在三个具有挑战性的代理任务上进行全面实验,WebShop、ALFWorld 和 Deep Search,我们展示了EMPG实现了显著的性能提升,显著优于强策略梯度基线。项目页面位于 https://empgseed-seed.github.io/
引用
@article{arxiv.2509.09265,
title = {Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents},
author = {Jiawei Wang and Jiacai Liu and Yuqian Fu and Yingru Li and Xintao Wang and Yuan Lin and Yu Yue and Lin Zhang and Yang Wang and Ke Wang},
journal= {arXiv preprint arXiv:2509.09265},
year = {2025}
}
备注
ICLR 2026 Under review