中文

面向深度强化学习泛化的自动数据增强

机器学习 2021-02-23 v2 人工智能

摘要

深度强化学习(RL)智能体常常无法泛化到未见过的场景,即便它们已在语义相似环境的众多实例上训练过。数据增强近来被证明可改善RL智能体的样本效率与泛化能力。然而,不同任务往往受益于不同种类的数据增强。本文比较了三种自动寻找合适增强方法的途径。这些方法与两项针对策略和值函数的新颖正则项相结合,以使数据增强在某些actor-critic算法中的使用在理论上严谨。我们在由16个程序生成环境组成的Procgen基准上评估了我们的方法,并显示其相对于标准RL算法将测试性能提升了约40%。我们的智能体优于其他专门设计用于改善RL泛化的基线。此外,我们展示了我们的智能体学到了对环境变化(如背景)更鲁棒的策略与表征,而这些变化并不影响智能体。我们的实现位于 https://github.com/rraileanu/auto-drac。

关键词

引用

@article{arxiv.2006.12862,
  title  = {Automatic Data Augmentation for Generalization in Deep Reinforcement Learning},
  author = {Roberta Raileanu and Max Goldstein and Denis Yarats and Ilya Kostrikov and Rob Fergus},
  journal= {arXiv preprint arXiv:2006.12862},
  year   = {2021}
}