DISCOVER:稀疏奖励强化学习的自动课程发现
机器学习
2025-10-21 v2 人工智能
机器人学
摘要
稀疏奖励强化学习(RL)可以建模广泛的高度复杂任务。解决稀疏奖励任务是 RL 的核心前提,要求高效探索并实现长期信用分配,这些挑战的克服是构建超人类能力自我改进智能体的关键。先前的工作常以解决众多稀疏奖励任务为目标,使得对单个高维、长期任务的探索变得不可行。我们认为,解决此类具挑战性的任务需要解决与目标任务相关的更简单任务,即实现这些任务将教会智能体解决目标任务所需的技能。我们展示了,这种必要的探索方向可从现有 RL 算法中提取,无需依赖任何先验信息。为此,我们提出了一种针对稀疏奖励、目标条件的超长期 RL(DISCOVER)的方法,通过选择目标导向的探索目标来实现。我们将 DISCOVER 与 bandits 中的原则性探索相连接,形式性地界定了目标任务可实现的时间上界,依据的是智能体初始到目标的距离,但独立于所有任务空间的体积。随后我们在高维环境中进行了彻底的评估。我们发现,DISCOVER 的目标导向选择方式解决了先前 SOTA 探索方法在 RL 中无法触及的探索问题。
引用
@article{arxiv.2505.19850,
title = {DISCOVER: Automated Curricula for Sparse-Reward Reinforcement Learning},
author = {Leander Diaz-Bone and Marco Bagatella and Jonas Hübotter and Andreas Krause},
journal= {arXiv preprint arXiv:2505.19850},
year = {2025}
}
备注
NeurIPS 2025