为无监督环境设计奠定偶然不确定性基础
机器学习
2022-10-25 v2 人工智能
机器学习
摘要
强化学习(RL)中的自适应课程已被证明能有效产生对训练与测试环境间差异具有鲁棒性的策略。近来,无监督环境设计(UED)框架将 RL 课程推广到生成完整环境的序列,催生了具有鲁棒极小极大遗憾性质的新方法。问题在于,在部分可观测或随机设定下,最优策略可能依赖于目标部署设定中环境偶然参数的真实分布,而课程学习必然偏移训练分布。我们将此现象形式化为课程诱导协变量偏移(CICS),并描述其在偶然参数中的发生如何导致次优策略。直接从真实分布采样这些参数可避免该问题,但会阻碍课程学习。我们提出 SAMPLR,一种极小极大遗憾 UED 方法,即使底层训练数据因 CICS 存在偏倚,也能优化真实效用函数。我们证明并在具有挑战性的领域上验证,我们的方法在真实分布下保持最优性,同时促进跨全部环境设定的鲁棒性。
引用
@article{arxiv.2207.05219,
title = {Grounding Aleatoric Uncertainty for Unsupervised Environment Design},
author = {Minqi Jiang and Michael Dennis and Jack Parker-Holder and Andrei Lupu and Heinrich Küttler and Edward Grefenstette and Tim Rocktäschel and Jakob Foerster},
journal= {arXiv preprint arXiv:2207.05219},
year = {2022}
}
备注
NeurIPS 2022