中文

通过无监督环境设计实现涌现复杂性与零样本迁移

机器学习 2021-02-05 v2 人工智能 多智能体系统

摘要

广泛的强化学习(RL)问题——包括鲁棒性、迁移学习、无监督 RL 和涌现复杂性——都需要指定一个策略将被训练于其中的任务或环境分布。然而,创建有用的环境分布容易出错,且耗费开发者大量的时间与精力。我们提出无监督环境设计(UED)作为一种替代范式,开发者提供带有未知参数的环境,这些参数被用于自动生成关于有效、可解环境的分布。现有自动生成环境的方法存在常见失败模式:域随机化无法生成结构或使环境难度适应智能体的学习进度,而极小极大对抗训练导致常为不可解的最坏情况环境。为我们的主角智能体生成结构化、可解的环境,我们引入第二个、与环境生成对手结盟的对抗智能体。该对手的动机是生成使遗憾最大化的环境,遗憾定义为主角与对抗智能体回报之差。我们称该技术为主角-对抗者诱导遗憾环境设计(PAIRED)。我们的实验表明,PAIRED 产生了日益复杂环境的自然课程,且 PAIRED 智能体在高度新颖环境中测试时实现了更高的零样本迁移性能。

关键词

引用

@article{arxiv.2012.02096,
  title  = {Emergent Complexity and Zero-shot Transfer via Unsupervised Environment Design},
  author = {Michael Dennis and Natasha Jaques and Eugene Vinitsky and Alexandre Bayen and Stuart Russell and Andrew Critch and Sergey Levine},
  journal= {arXiv preprint arXiv:2012.02096},
  year   = {2021}
}