用于多目标强化学习自适应探索的Stein变分目标生成
机器学习
2023-05-03 v2
摘要
在多目标强化学习中,智能体可在相关训练任务间共享经验,从而对新任务在测试时获得更好的泛化能力。然而,当目标空间存在不连续性且奖励稀疏时,大多数目标难以达到。在此背景下,对目标施加课程学习可通过使训练任务适配智能体当前能力来帮助其学习。本工作中我们提出Stein变分目标生成(SVGG),其利用智能体目标达成能力的习得预测模型,为其采样具有中等难度的目标。目标分布由粒子建模,这些粒子通过Stein变分梯度下降被吸引至难度适宜的区域。我们表明,在困难探索问题中,SVGG在成功覆盖率上优于最先进的多目标强化学习方法,并证明其在环境变化时具备一种有用的恢复特性。
引用
@article{arxiv.2206.06719,
title = {Stein Variational Goal Generation for adaptive Exploration in Multi-Goal Reinforcement Learning},
author = {Nicolas Castanet and Sylvain Lamprier and Olivier Sigaud},
journal= {arXiv preprint arXiv:2206.06719},
year = {2023}
}