通过对抗环境设计发现通用强化学习算法
机器学习
2023-10-05 v1 人工智能
摘要
在过去的十年中,基于人类研究者手动设计算法,深度强化学习(RL)取得了巨大进展。最近,研究表明可以元学习更新规则,期望发现能在广泛RL任务上表现良好的算法。尽管如学习策略梯度(LPG)等算法给出了令人印象深刻的初步结果,但这些算法在应用于未见环境时仍存在泛化差距。在本工作中,我们考察元训练分布的特征如何影响这些算法的泛化性能。受此分析启发并基于无监督环境设计(UED)的思想,我们提出了一种自动生成课程以最大化元学习优化器遗憾值的新方法,以及一种我们称之为算法遗憾(AR)的遗憾值新近似。由此得到我们的方法,即通过环境设计获得的通用RL优化器(GROOVE)。在一系列实验中,我们表明GROOVE取得了优于LPP的泛化性能,并将AR与UED的基线度量进行比较,确认其为此环境下环境设计的关键组成部分。我们相信该方法朝发现真正通用的RL算法迈出了一步,这类算法能够解决广泛的真实世界环境。
引用
@article{arxiv.2310.02782,
title = {Discovering General Reinforcement Learning Algorithms with Adversarial Environment Design},
author = {Matthew Thomas Jackson and Minqi Jiang and Jack Parker-Holder and Risto Vuorio and Chris Lu and Gregory Farquhar and Shimon Whiteson and Jakob Nicolaus Foerster},
journal= {arXiv preprint arXiv:2310.02782},
year = {2023}
}
备注
Published at NeurIPS 2023