通过发现内在选项进行分层强化学习
机器学习
2022-08-10 v3
摘要
我们提出一种分层强化学习方法HIDIO,它能以自监督方式学习任务无关的选项,同时联合学习利用这些选项来解决稀疏奖励任务。不同于当前倾向于表述达目标低层任务或预定义特定临时低层策略的分层RL方法,HIDIO鼓励独立于当前任务的低层选项学习,仅需少量关于任务结构的假设或知识。这些选项通过以选项子轨迹为条件的内在熵最小化目标学习得到。所学选项多样且任务无关。在稀疏奖励机器人操纵与导航任务的实验中,HIDIO相较常规RL基线与两种最先进的分层RL方法取得了更高的成功率与更强的采样效率。
引用
@article{arxiv.2101.06521,
title = {Hierarchical Reinforcement Learning By Discovering Intrinsic Options},
author = {Jesse Zhang and Haonan Yu and Wei Xu},
journal= {arXiv preprint arXiv:2101.06521},
year = {2022}
}
备注
ICLR 2021. 19 pages, 9 figures. Code at https://www.github.com/jesbu1/hidio