基于策略感知对抗数据增强的强化学习泛化
机器学习
2021-12-06 v2
摘要
强化学习(RL)中的泛化鸿沟一直是阻碍 RL 智能体学习通用技能并适应多变环境的重要障碍。提升 RL 系统的泛化能力可显著改善其在真实工作环境中的表现。本工作中,我们提出一种新颖的策略感知对抗数据增强方法,利用自动生成的轨迹数据来增强标准策略学习方法。与常用的基于观测变换的数据增强不同,我们所提方法基于策略梯度目标对抗地生成新轨迹数据,旨在以策略感知的数据增强更有效地提升 RL 智能体的泛化能力。此外,我们进一步部署一个 mixup 步骤来整合原始数据与生成数据,在增强泛化能力的同时缓解对抗数据的过度偏离。我们在若干 RL 任务上开展实验,通过与标准基线及最先进的 mixreg 方法比较来考察所提方法的泛化性能。结果表明,我们的方法能在有限训练多样性下良好泛化,并达到最先进的泛化测试性能。
引用
@article{arxiv.2106.15587,
title = {Generalization of Reinforcement Learning with Policy-Aware Adversarial Data Augmentation},
author = {Hanping Zhang and Yuhong Guo},
journal= {arXiv preprint arXiv:2106.15587},
year = {2021}
}