利用数据增强以卷积网络与视觉Transformer稳定深度Q学习
机器学习
2021-12-10 v2 计算机视觉与模式识别
机器人学
摘要
尽管通过强化学习(RL)训练的智能体能够直接从视觉观测中解决日益复杂的任务,但将习得的技能泛化到新环境仍然极具挑战。广泛使用数据增强是一种有望改善RL泛化的技术,但常被发现会降低样本效率,甚至导致发散。本文研究了在常见离策略RL算法中使用数据增强时不稳定性的成因。我们识别出两个问题,均根源于高方差的Q目标。基于我们的发现,我们提出了一种简单而有效的技术,用于稳定此类算法在增强下的训练。我们基于DeepMind Control Suite的一系列基准以及机器人操作任务,使用卷积网络与视觉Transformer(ViT)对基于图像的RL进行了广泛的实证评估。我们的方法大幅提升了卷积网络在增强下的稳定性与样本效率,并在具有未见视觉环境的中基于图像的RL中取得了与最先进方法相竞争的泛化结果。我们进一步表明,我们的方法可扩展到基于ViT架构的RL,且数据增强在此设定下可能尤为重要。
引用
@article{arxiv.2107.00644,
title = {Stabilizing Deep Q-Learning with ConvNets and Vision Transformers under Data Augmentation},
author = {Nicklas Hansen and Hao Su and Xiaolong Wang},
journal= {arXiv preprint arXiv:2107.00644},
year = {2021}
}
备注
Code and videos are available at https://nicklashansen.github.io/SVEA