中文

Actor-Critic 中的高估、过拟合与可塑性:强化学习的惨痛教训

机器学习 2024-06-21 v2

摘要

近期离策略强化学习 (RL) 的进展显著提高了样本效率,这主要归功于各种形式的正则化技术的引入,使得比传统智能体更多的梯度更新步骤成为可能。然而,许多此类技术仅在有限设置中进行了测试,通常是在单一模拟基准的任务上,并且是针对知名算法而非一系列正则化方法进行的。这限制了我们对驱动 RL 改进的具体机制的理解。为解决这一问题,我们实现了超过 60 种不同的离策略智能体,每种都集成了来自近期最先进算法的既定正则化技术。我们在来自 2 个模拟基准的 14 个多样化任务上测试了这些智能体,测量了与高估、过拟合和可塑性损失相关的训练指标——这些问题正是所考察的正则化技术的动机所在。我们的研究结果表明,虽然特定正则化设置的有效性随任务而变化,但某些组合始终表现出稳健且优越的性能。值得注意的是,一个经过适当正则化的简单 Soft Actor-Critic 智能体,能够在训练机制内可靠地找到性能更好的策略,而此前这主要通过基于模型的方法实现。

关键词

引用

@article{arxiv.2403.00514,
  title  = {Overestimation, Overfitting, and Plasticity in Actor-Critic: the Bitter Lesson of Reinforcement Learning},
  author = {Michal Nauman and Michał Bortkiewicz and Piotr Miłoś and Tomasz Trzciński and Mateusz Ostaszewski and Marek Cygan},
  journal= {arXiv preprint arXiv:2403.00514},
  year   = {2024}
}

备注

ICML 2024