中文

分层模仿与强化学习

机器学习 2018-06-12 v2 人工智能 机器学习

摘要

我们研究如何有效利用专家反馈来学习序列决策策略。我们关注具有稀疏奖励和长时间跨度的任务,这类问题通常在强化学习中构成显著挑战。我们提出一种称为分层指导的算法框架,利用底层问题的层次结构来整合不同模式的专家交互。我们的框架可以在不同层级结合不同的模仿学习(IL)与强化学习(RL)组合,从而大幅减少专家投入与探索代价。利用包括 Montezuma's Revenge 在内的长跨度基准,我们证明了我们的方法比分层 RL 学习显著更快,且比标准 IL 显著更节省标注。我们还从理论角度分析了框架某些实例的标注代价。

关键词

引用

@article{arxiv.1803.00590,
  title  = {Hierarchical Imitation and Reinforcement Learning},
  author = {Hoang M. Le and Nan Jiang and Alekh Agarwal and Miroslav Dudík and Yisong Yue and Hal Daumé},
  journal= {arXiv preprint arXiv:1803.00590},
  year   = {2018}
}

备注

Proceedings of the 35th International Conference on Machine Learning (ICML 2018)