循环熵喷发:智能体强化学习中的熵动力学
机器学习
2026-05-28 v1
摘要
智能体大语言模型日益用于通过推理目标、调用工具和与外部环境交互来解决实际任务。强化学习为改进这些行为提供了自然框架,近期的智能体强化学习方法在多个领域取得了显著成果。然而,智能体强化学习的训练动力学仍鲜有了解,限制了我们诊断不稳定性和设计更有效训练算法的能力。在本文中,我们识别出智能体强化学习中一个此前较少探讨的现象,称为循环熵喷发。不同于单轮推理强化学习,其中熵通常会迅速下降并保持在低位,智能体强化学习训练表现出锐利熵喷发和逐渐衰减的独特循环周期。我们将这一动力学分解为三个阶段,提供该循环振荡机制的理论与实证分析。我们进一步表明,一旦在喷发期获得的退化模式(如句子重复和幻觉),可在循环间持续积累。针对这些发现,我们提出 SEAL(Separation-Enhanced Agent Learning),一种轻量级辅助损失,通过在表示空间中分离正确和错误轨迹,直接针对熵喷发的根本原因。跨多个基准、模型和强化学习算法的实验表明,SEAL 稳定了训练,显著提升了下游智能体性能。
引用
@article{arxiv.2605.27954,
title = {Cyclical Entropy Eruption: Entropy Dynamics in Agent Reinforcement Learning},
author = {Wendi Li and Shawn Im and Sharon Li},
journal= {arXiv preprint arXiv:2605.27954},
year = {2026}
}