SHIRO:软分层强化学习
机器人学
2022-12-27 v1 机器学习
摘要
分层强化学习(HRL)算法已被证明在高维决策与机器人控制任务上表现良好。然而,由于其仅优化奖励,智能体倾向于冗余地搜索同一空间。该问题降低了学习速度与所获奖励。本工作中,我们提出一种离策略 HRL 算法,其最大化熵以实现高效探索。该算法学习时间抽象的底层策略,并通过向高层添加熵实现广泛探索。本工作的新颖之处在于在 HRL 设定下向 RL 目标添加熵的理论动机。我们通过实验表明,若底层策略连续更新间的 Kullback-Leibler(KL)散度足够小,则熵可添加至两个层级。我们进行了消融研究以分析熵对分层结构的影响,其中向高层添加熵成为最理想的配置。此外,底层较高的温度会导致 Q 值高估,并增加高层所作用环境的随机性,使学习更具挑战性。我们的方法 SHIRO 在一系列模拟机器人控制基准任务上超越最先进(SOTA)性能,且所需调参极少。
引用
@article{arxiv.2212.12786,
title = {SHIRO: Soft Hierarchical Reinforcement Learning},
author = {Kandai Watanabe and Mathew Strong and Omer Eldar},
journal= {arXiv preprint arXiv:2212.12786},
year = {2022}
}