中文

改进无监督动态环境生成的遗憾近似

机器学习 2026-01-22 v1

摘要

无监督环境设计(Unsupervised Environment Design, UED)旨在为强化学习(Reinforcement Learning, RL)智能体自动生成训练课程,目标是提升泛化能力和零样本性能。然而,设计有效的课程仍然是一个难题,尤其是在少数环境参数化子集导致所需策略复杂度显著增加的场景中。当前方法面临困难的信用分配问题,且所依赖的遗憾近似无法识别具有挑战性的关卡,这两个问题随着环境规模的增大而加剧。我们提出了用于 UED 的动态环境生成(Dynamic Environment Generation for UED, DEGen),以实现更密集的关卡生成器奖励信号,降低信用分配的难度,并使 UED 能够扩展到更大的环境规模。我们还引入了一种新的遗憾近似——最大化负优势(Maximised Negative Advantage, MNA),作为一个显著改进的优化指标,能更好地识别更具挑战性的关卡。我们通过实验证明,MNA 优于当前的遗憾近似方法,且与 DEGen 结合时,始终优于现有方法,尤其是在环境规模增大时。我们已在此处公开所有代码:https://github.com/HarryMJMead/Dynamic-Environment-Generation-for-UED。

关键词

引用

@article{arxiv.2601.14957,
  title  = {Improving Regret Approximation for Unsupervised Dynamic Environment Generation},
  author = {Harry Mead and Bruno Lacerda and Jakob Foerster and Nick Hawes},
  journal= {arXiv preprint arXiv:2601.14957},
  year   = {2026}
}