中文

学习中断:一种用于高效探索的分层深度强化学习框架

人工智能 2018-07-31 v1 机器人学

摘要

为实现场景智能,人类必须通过开发面向目标的算法将知识迁移给机器人,这些算法有时对动态变化的环境不敏感。尽管深度强化学习近期取得显著成功,直接部署到真实机器人仍极为困难。本文提出一种名为Option-Interruption的混合结构,将人类知识嵌入分层强化学习框架。我们的架构有两个关键组件:由现有人工设计方法表示的选项(options)可显著加速训练过程,以及基于可学习终止函数的中断机制使系统能快速响应外部环境。为实现该架构,我们基于策略梯度方法导出一组更新规则并给出完整训练过程。在实验部分,我们的方法在四房间导航与探索任务中评估,显示了框架的效率与灵活性。

关键词

引用

@article{arxiv.1807.11150,
  title  = {Learning to Interrupt: A Hierarchical Deep Reinforcement Learning Framework for Efficient Exploration},
  author = {Tingguang Li and Jin Pan and Delong Zhu and Max Q. -H. Meng},
  journal= {arXiv preprint arXiv:1807.11150},
  year   = {2018}
}

备注

6 pages, 6 figures