基于自博弈的多样性诱导环境设计
人工智能
2023-07-26 v4 机器学习
摘要
近期关于设计适当环境分布的研究显示出训练高效通用智能体的潜力。其成功部分归因于一种自适应课程学习形式,该形式能在智能体能力前沿生成环境实例(或关卡)。然而,此类环境设计框架往往难以在具有挑战性的设计空间中找到有效关卡,且需要与环境进行代价高昂的交互。本文旨在将多样性引入无监督环境设计(UED)框架。具体而言,我们提出一种任务无关的方法来识别代表给定关卡的观测/隐藏状态。该方法的结果随后被用于刻画两个关卡之间的多样性,我们证明这对有效性能至关重要。此外,为提高采样效率,我们引入了自博弈技术,使环境生成器能自动生成对训练智能体大有裨益的环境。定量结果表明,我们的方法——基于自博弈的多样性诱导环境设计(DivSP)——展现出优于现有方法的显著性能。
引用
@article{arxiv.2302.02119,
title = {Diversity Induced Environment Design via Self-Play},
author = {Dexun Li and Wenjun Li and Pradeep Varakantham},
journal= {arXiv preprint arXiv:2302.02119},
year = {2023}
}