利用学习型对手稳定无监督环境设计
机器学习
2023-08-23 v2 人工智能
摘要
训练具备通用能力的智能体的一个关键挑战是设计训练任务,以促进广泛的泛化能力和对环境变化的鲁棒性。这一挑战推动了无监督环境设计(UED)问题设定的产生,即学生智能体在教师智能体提出的自适应任务分布上进行训练。UED 的一种开创性方法是 PAIRED,它使用强化学习(RL)来训练教师策略从头设计任务,使得直接生成适应智能体当前能力的任务成为可能。尽管有坚实的理论支持,PAIRED 仍面临阻碍其实际性能的各种挑战。因此,目前最先进的方法依赖于任务的筛选和突变,而不是生成新任务。在这项工作中,我们研究了 PAIRED 的几个关键缺陷,并针对每个缺陷提出了解决方案。结果,我们使 PAIRED 能够匹配或超越最先进的方法,在几个公认的、具有挑战性的程序化生成环境中产生鲁棒的智能体,包括一个部分可观测的迷宫导航任务和一个连续控制的赛车环境。我们相信这项工作促使人们重新重视基于学习模型的 UED 方法,这些模型直接生成具有挑战性的环境,有可能解锁更加开放式的 RL 训练,从而产生更通用的智能体。
引用
@article{arxiv.2308.10797,
title = {Stabilizing Unsupervised Environment Design with a Learned Adversary},
author = {Ishita Mediratta and Minqi Jiang and Jack Parker-Holder and Michael Dennis and Eugene Vinitsky and Tim Rocktäschel},
journal= {arXiv preprint arXiv:2308.10797},
year = {2023}
}
备注
CoLLAs 2023 - Oral; Second and third authors contributed equally