自节奏高斯情境强化学习
机器学习
2026-03-26 v1 人工智能
摘要
课程学习通过将任务从简单到复杂地排序来提高强化学习(RL)的效率。然而,许多自节奏课程方法依赖于计算昂贵的内循环优化,限制了其在高维情境空间中的可扩展性。本文提出了自节奏高斯情境强化学习(Self-Paced Gaussian Curriculum Learning, SPGL),一种新方法,通过利用高斯情境分布的闭式更新规则,避免了昂贵的数值程序。SPGL 保持了传统自节奏方法的样本效率和适应性,同时大幅降低了计算开销。我们对收敛性提供了理论保证,并在几个情境 RL 基准测试中验证了该方法,包括 Point Mass、Lunar Lander 和 Ball Catching 环境。实验结果表明,SPGL 在匹配或超越现有课程方法方面表现出色,尤其在隐藏情境场景下,实现了更稳定的情境分布收敛。我们的方法为在具有挑战性的连续域和部分可观测域中的课程生成提供了一个可扩展且原则化的替代方案。
引用
@article{arxiv.2603.23755,
title = {Self Paced Gaussian Contextual Reinforcement Learning},
author = {Mohsen Sahraei Ardakani and Rui Song},
journal= {arXiv preprint arXiv:2603.23755},
year = {2026}
}
备注
16 pages, 10 figures