中文

反主动 RL:为高效可扩展深度强化学习重思核心原则

机器学习 2026-03-18 v1 人工智能

摘要

在仅通过与环境交互而无任何监督的情况下学习赢得任务的策略取得了突破性成功后,强化学习代理已具备在复杂 MDP 中作出顺序决策的能力。然而,强化学习策略在高维 MDP 中会面临指数级状态空间,导致计算复杂度与策略成功之间呈现二元对立。在本论文中,我们聚焦于代理在学习阶段与环境的交互,尤其是在高维 MDP 中,我们提出一种基于通过反主动动作获得的经验,建立在经验之上的新范式。我们的分析和方法为高效、有效、可扩展且加速的学习提供了理论依据,同时计算复杂度为零,却在训练中实现了显著加速。我们在 Arcade Learning Environment 中进行大量实验,使用高维状态表示的 MDP。实验结果进一步验证了我们的理论分析,本方法在高维环境中实现了显著的性能提升并大幅提高了样本效率。

关键词

引用

@article{arxiv.2603.15871,
  title  = {Counteractive RL: Rethinking Core Principles for Efficient and Scalable Deep Reinforcement Learning},
  author = {Ezgi Korkmaz},
  journal= {arXiv preprint arXiv:2603.15871},
  year   = {2026}
}

备注

NeurIPS 2025 Spotlight