一种无监督环境设计的优化框架
机器学习
2025-07-10 v2
摘要
为使强化学习智能体能够部署在高风险环境中,它们必须对不熟悉的场景具有高度的鲁棒性。提升鲁棒性的一种方法是无监督环境设计(UED),这是一套旨在最大化智能体在环境各种配置上泛化能力的方法。在这项工作中,我们从优化的角度研究 UED,为实际环境提供了比先前工作更强的理论保证。先前的方法依赖于收敛时才能获得的保证,而我们的框架采用了一个非凸-强凹目标,并为此提供了一个在零和设定下可证明收敛的算法。我们通过实验验证了该方法的有效性,在多个不同难度的环境中,其性能优于先前的方法。
引用
@article{arxiv.2505.20659,
title = {An Optimisation Framework for Unsupervised Environment Design},
author = {Nathan Monette and Alistair Letcher and Michael Beukman and Matthew T. Jackson and Alexander Rutherford and Alexander D. Goldie and Jakob N. Foerster},
journal= {arXiv preprint arXiv:2505.20659},
year = {2025}
}
备注
Reinforcement Learning Conference 2025