调制策略层次结构
机器学习
2018-12-04 v1 人工智能
摘要
解决稀疏奖励任务是强化学习中的主要挑战。虽然分层控制器是解决该问题的直观方法,但现有方法通常需要人工奖励塑形、交替训练阶段或人工定义的子任务。我们提出了调制策略层次结构(MPH),其能够端到端学习以从稀疏奖励解决任务。为此,我们研究了分层控制器的不同调制信号与探索方式。具体而言,我们发现通过比特向量进行通信比从多个技能中选择一个更高效,因为前者能够实现技能之间的混合。为促进探索,MPH 在层次结构的每一层利用其不同的时间尺度实现时间扩展的内在动机。我们在推动和稀疏积木堆叠的机器人任务上评估了 MPH,其性能优于近期基线方法。
引用
@article{arxiv.1812.00025,
title = {Modulated Policy Hierarchies},
author = {Alexander Pashevich and Danijar Hafner and James Davidson and Rahul Sukthankar and Cordelia Schmid},
journal= {arXiv preprint arXiv:1812.00025},
year = {2018}
}
备注
8 pages, 5 figures