中文

CARL:关键性感知智能体强化学习

机器学习 2026-05-12 v3 人工智能 计算与语言

摘要

能够通过与环境的多次交互来完成复杂任务的智能体已成为一个流行的研究方向。然而,在此类多步骤设置中,传统的组级策略优化算法由于其底层假设每一步贡献相等而变得次优,这与现实严重偏离。我们的分析表明,只有极少数状态上的动作选择对于决定最终结果是关键的。基于这一洞察,我们提出了 CARL,一种专为长时序智能体推理设计的关键性感知强化学习算法。CARL 利用熵作为状态关键性的启发式代理,并通过为来自高关键性状态的动作分配奖励、同时将来自低关键性状态的动作排除在模型更新之外来实现聚焦训练,从而避免了噪声信用分配和冗余计算。大量实验表明,CARL 在多样化的评估设置中同时实现了更强的性能和更高的效率。源代码将公开发布。

关键词

引用

@article{arxiv.2512.04949,
  title  = {CARL: Criticality-Aware Agentic Reinforcement Learning},
  author = {Leyang Shen and Yang Zhang and Chun Kai Ling and Xiaoyan Zhao and Tat-Seng Chua},
  journal= {arXiv preprint arXiv:2512.04949},
  year   = {2026}
}

备注

18 pages, 6 figures