回放引导的对抗环境设计
机器学习
2022-01-17 v2 人工智能
摘要
深度强化学习(RL)智能体若在以适当多样性环境和任务配置集上训练,可成功泛化至新设定。无监督环境设计(UED)是一种有前景的自监督 RL 范式,其中欠指定环境的自由参数在训练期间依据智能体能力自动适配,从而涌现多样化训练环境。此处,我们将 Prioritized Level Replay(PLR)——一种经验成功但理论上无动机、选择性采样随机生成训练关卡的方法——视为 UED。我们认为,通过筛选完全随机的关卡,PLR 同样可生成新颖且复杂的关卡以实现有效训练。该洞见揭示了一类自然的 UED 方法,我们称之为双课程设计(DCD)。关键在于,DCD 将 PLR 与一种流行的 UED 算法 PAIRED 均作为特例包含,并继承类似理论保证。该联系使我们能为 PLR 发展新理论,提供在纳什均衡处具鲁棒性保证的版本。此外,我们的理论暗示了对 PLR 高度反直觉的改进:通过阻止智能体在未筛选关卡上更新其策略(以更少数据训练),可改善至纳什均衡的收敛。的确,我们的实验证实新法 PLR 在一组分布外零样本迁移任务上取得更好结果,并进一步表明 PLR 提升了其所继承理论框架的 PAIRED 的性能。
引用
@article{arxiv.2110.02439,
title = {Replay-Guided Adversarial Environment Design},
author = {Minqi Jiang and Michael Dennis and Jack Parker-Holder and Jakob Foerster and Edward Grefenstette and Tim Rocktäschel},
journal= {arXiv preprint arXiv:2110.02439},
year = {2022}
}
备注
NeurIPS 2021