ARIA:基于意图驱动奖励聚合的语言智能体训练
计算与语言
2025-06-05 v2
摘要
大型语言模型(LLMs)使智能体能够通过自由形式的语言交互执行复杂的推理与决策。然而,在开放式语言动作环境(例如谈判或提问游戏)中,动作空间可表述为 token 上的联合分布,导致动作空间呈指数级增长。在此类空间中采样动作会导致极端的奖励稀疏性,进而带来较大的奖励方差,阻碍有效的强化学习(RL)。为解决此问题,我们提出了 ARIA,一种在意图空间聚合奖励以实现高效且有效的语言智能体训练的方法。ARIA 旨在将自然语言动作从高维联合 token 分布空间投影至低维意图空间,其中语义相似的动作被聚类并分配共享奖励。这种意图感知的奖励聚合通过稠密化奖励信号来降低奖励方差,从而促进更好的策略优化。大量实验表明,ARIA 不仅显著降低了策略梯度方差,还在四个下游任务上平均带来了 9.95% 的显著性能提升,持续优于离线和在线 RL 基线方法。
引用
@article{arxiv.2506.00539,
title = {ARIA: Training Language Agents with Intention-Driven Reward Aggregation},
author = {Ruihan Yang and Yikai Zhang and Aili Chen and Xintao Wang and Siyu Yuan and Jiangjie Chen and Deqing Yang and Yanghua Xiao},
journal= {arXiv preprint arXiv:2506.00539},
year = {2025}
}