从像素稳定离策略深度强化学习
机器学习
2022-07-05 v1 人工智能
计算机视觉与模式识别
摘要
从像素观测进行的离策略强化学习(RL)以极度不稳定著称。因此,许多成功算法必须结合不同的领域特定实践和辅助损失,以在复杂环境中学习有意义的行为。本工作中,我们提供了新颖分析,证明这些不稳定性源于使用卷积编码器和低量级奖励进行时序差分学习。我们表明这一新的“视觉致命三元组”导致训练不稳定并过早收敛到退化解,我们将此现象命名为灾难性自过拟合。基于我们的分析,我们提出 A-LIX,一种通过对编码器梯度提供自适应正则化、利用双目标显式防止灾难性自过拟合发生的方法。通过应用 A-LIX,我们在 DeepMind Control 和 Atari 100k 基准上显著优于先前最先进水平,且无需任何数据增强或辅助损失。
引用
@article{arxiv.2207.00986,
title = {Stabilizing Off-Policy Deep Reinforcement Learning from Pixels},
author = {Edoardo Cetin and Philip J. Ball and Steve Roberts and Oya Celiktutan},
journal= {arXiv preprint arXiv:2207.00986},
year = {2022}
}
备注
Short presentation at ICML 2022