无任务特定知识的自主强化学习自监督课程生成
机器学习
2024-02-20 v2 机器人学
摘要
将当前强化学习算法应用于现实场景的一个重大瓶颈在于需要在每个回合之间重置环境。这一重置过程需要大量人工干预,使得智能体难以持续自主地学习。近期的若干工作提出了自主强化学习(ARL)算法,通过生成课程来联合训练重置策略与前向策略。尽管它们的课程能够通过考虑智能体的学习进度来减少所需的人工重置次数,但它们依赖于任务特定知识,例如预定义的初始状态或重置奖励函数。在本文中,我们提出了一种新颖的 ARL 算法,能够生成适应智能体学习进度且无需任务特定知识的课程。我们的课程使智能体能够自主重置到多样化且信息丰富的初始状态。为实现这一点,我们引入了一个成功判别器,用于估计当智能体遵循前向策略时从每个初始状态出发的成功概率。该成功判别器以自监督方式通过重新标记的转移进行训练。我们的实验结果表明,我们的 ARL 算法能够生成自适应课程,并使智能体高效地自举以解决稀疏奖励迷宫导航与操控任务,在以显著更少的人工重置次数下优于基线方法。
引用
@article{arxiv.2311.09195,
title = {Self-Supervised Curriculum Generation for Autonomous Reinforcement Learning without Task-Specific Knowledge},
author = {Sang-Hyun Lee and Seung-Woo Seo},
journal= {arXiv preprint arXiv:2311.09195},
year = {2024}
}
备注
8 pages, 8 figures