深度选项的多层级发现
机器学习
2017-10-06 v2
摘要
用称为选项的有用高层行为来增强智能体的控制,可以大幅降低强化学习的样本复杂度,但在高维和抽象状态空间中手动设计选项是不可行的。尽管近期工作提出了几种自动选项发现技术,但它们无法扩展到多层级层次结构以及深度网络等富有表达力的表示。我们提出深度选项发现(Discovery of Deep Options, DDO),这是一种策略梯度算法,能从一组示范轨迹中发现参数化选项,并可递归地用于发现层次结构的更多层级。我们的方法对多层级层次结构的可扩展性源于高层元控制策略学习与低层选项发现的解耦,这得益于高层的欠参数化。我们证明,使用发现的选项来增强深度Q网络智能体的动作空间,可以通过在随机动作不太可能到达有价值状态的任务中引导探索来加速学习。我们展示,在实验选择的5个Atari RAM环境中的4个里,DDO能有效添加选项以加速学习。我们还展示,DDO能在机器人辅助手术视频和运动学中发现结构,其与专家标注的匹配准确率达到72%。
引用
@article{arxiv.1703.08294,
title = {Multi-Level Discovery of Deep Options},
author = {Roy Fox and Sanjay Krishnan and Ion Stoica and Ken Goldberg},
journal= {arXiv preprint arXiv:1703.08294},
year = {2017}
}