中文

并非所有转移都重要:来自PPO的证据

机器学习 2026-05-27 v2 人工智能

摘要

在策略上训练强化学习智能体意味着在每次更新时收集新的经验,而这种经验伴随着一个隐藏的问题。轨迹中的每个状态都是前一个状态的直接输出,通过智能体自身的动作因果链连接在一起。因此,连续的转移从来不是真正独立的。它们携带重叠的信息,网络接收到的梯度信号最终比批次大小所暗示的要重复得多。相同的方向被反复强化,随着策略的变化,价值网络难以跟上,训练变得悄然不稳定,而仅凭奖励曲线很少能揭示这一点。本文探讨了这种冗余是否可以被简单地移除。我们表明,在适当阶段从轨迹中随机丢弃固定比例的转移,同时保持奖励信号完整,足以打破重复的梯度结构并稳定训练。这一改变微乎其微:一个采样步骤,没有新组件,不修改核心算法,并且适用于任何PPO实现。在五个难度递增的环境(CartPole-v1、Acrobot-v1、LunarLander-v2、HalfCheetah-v5和Hopper-v5)中,该方法在奖励上与原始PPO相匹配,同时在KL散度、策略熵和价值估计方面产生了更一致的训练动态。丢弃25%的转移被证明是最佳点:足以破坏冗余,又不会使批次过于稀疏。

关键词

引用

@article{arxiv.2605.24071,
  title  = {Not All Transitions Matter: Evidence from PPO},
  author = {Ajhesh Basnet},
  journal= {arXiv preprint arXiv:2605.24071},
  year   = {2026}
}

备注

19 pages, 5 figures. Accepted to 2026 8th Asia Conference on Machine Learning and Computing (ACMLC 2026)