中文

通过软数据增强提升强化学习的泛化能力

机器学习 2021-04-12 v2

摘要

人们已做出大量努力,通过域随机化和数据增强来提升强化学习(RL)方法的泛化能力。然而,随着训练过程中引入更多的变化因素,优化变得愈发困难,并且在经验上可能导致更低的样本效率和更不稳定的训练。我们提出软数据增强(SODA),一种将增强与策略学习解耦的方法,而非直接从增强数据学习策略。具体而言,SODA 对编码器施加一个软约束,旨在最大化增强数据与未增强数据潜在表示之间的互信息,而 RL 优化过程严格使用未增强数据。我们在 DeepMind Control 套件的多种任务以及一项机器人操作任务上进行了经验评估,发现 SODA 相较于最先进的基于视觉的 RL 方法,在样本效率、泛化和训练稳定性方面均有显著提升。

关键词

引用

@article{arxiv.2011.13389,
  title  = {Generalization in Reinforcement Learning by Soft Data Augmentation},
  author = {Nicklas Hansen and Xiaolong Wang},
  journal= {arXiv preprint arXiv:2011.13389},
  year   = {2021}
}

备注

Website: https://nicklashansen.github.io/SODA/ Code: https://github.com/nicklashansen/dmcontrol-generalization-benchmark. Presented at International Conference on Robotics and Automation (ICRA) 2021