中文

梯度耦合:代理强化学习中泛化的隐藏障碍

人工智能 2026-01-16 v4

摘要

强化学习 (RL) 是训练自主代理的主导范式,但这些代理往往表现出较差的泛化能力,无法适应训练中未出现的情景。在本工作中,我们识别了这种脆弱性的根本原因,称为“梯度耦合”。我们假设在复杂的代理任务中,不同状态之间的高度相似性导致梯度之间的破坏性干扰。具体而言,一个强化某个状态下最优动作的梯度更新,可能会无意中增加相似但不同状态下次优动作的概率。为解决此问题,我们提出了一种新型目标函数,要求演员同时作为分类器,分离良好动作和差好动作。这种辅助压力迫使模型学习正向和负向动作的解耦嵌入,从而减轻负梯度干扰并提高泛化性能。大量实验表明,我们方法的有效性。

关键词

引用

@article{arxiv.2509.23870,
  title  = {Gradient Coupling: The Hidden Barrier to Generalization in Agentic Reinforcement Learning},
  author = {Jingyu Liu and Xiaopeng Wu and Jingquan Peng and Kehan Chen and Chuan Yu and Lizhong Ding and Yong Liu},
  journal= {arXiv preprint arXiv:2509.23870},
  year   = {2026}
}