面向稀疏奖励多目标强化学习的基于密度的课程学习
机器人学
2021-09-27 v2
摘要
多目标强化学习(RL)旨在使智能体具备完成多目标任务的能力,这对于学习可扩展的机器人操作技能具有重要意义。然而,奖励工程在多目标 RL 中常需耗费巨大精力。此外,它会引入不可避免的偏差,导致最终策略的次优性。稀疏奖励提供了一种简单而高效的方式以克服此类局限。尽管如此,它会损害探索效率,甚至阻碍策略收敛。本文提出一种基于密度的课程学习方法,以在稀疏奖励下实现高效探索,并对期望目标分布具备更好泛化能力。直观上,我们的方法鼓励机器人沿各方向逐步拓展其能力边界,以尽可能快速、全面地覆盖整个期望目标空间。为进一步提升数据效率与泛化性,我们在训练中对允许区域内的目标与转移进行增广。最后,我们在现有方法难以应对的多种基准操作任务变体上评估了我们的方法。实证结果表明,我们的方法在数据效率与成功率方面均优于最先进的基线。
引用
@article{arxiv.2109.08903,
title = {Density-based Curriculum for Multi-goal Reinforcement Learning with Sparse Rewards},
author = {Deyu Yang and Hanbo Zhang and Xuguang Lan and Jishiyu Ding},
journal= {arXiv preprint arXiv:2109.08903},
year = {2021}
}
备注
8 pages, 7 figures