基于多目标策略优化的强化学习策略组合
机器学习
2023-08-31 v2
摘要
我们使强化学习智能体能够利用相关的已有教师策略来学习成功的行为策略。在多目标策略优化设定中,除任务目标外,将教师策略作为目标引入。使用多目标最大后验策略优化算法(Abdolmaleki 等,2020),我们表明教师策略有助于加快学习,尤其在缺乏塑形奖励时。在具有连续观测与动作空间的两个领域中,我们的智能体成功地对教师策略进行顺序与并行组合,并能够进一步扩展教师策略以完成任务。取决于任务与教师指定的组合,教师可能自然地限制智能体最终性能。智能体遵循教师策略的程度由超参数决定,这些超参数同时决定教师对学习速度的影响以及智能体在任务上的最终性能。在人形领域(Tassa 等,2018),我们还赋予智能体控制教师选择的能力。借助该能力,智能体能够有意义地从教师策略中组合,在行走任务上获得优于无教师策略情形的任务奖励。我们通过视频展示了组合任务策略与相应教师策略的相似性。
引用
@article{arxiv.2308.15470,
title = {Policy composition in reinforcement learning via multi-objective policy optimization},
author = {Shruti Mishra and Ankit Anand and Jordan Hoffmann and Nicolas Heess and Martin Riedmiller and Abbas Abdolmaleki and Doina Precup},
journal= {arXiv preprint arXiv:2308.15470},
year = {2023}
}