分层模仿与强化学习
机器学习
2018-06-12 v2 人工智能
机器学习
摘要
我们研究如何有效利用专家反馈来学习序列决策策略。我们关注具有稀疏奖励和长时间跨度的任务,这类问题通常在强化学习中构成显著挑战。我们提出一种称为分层指导的算法框架,利用底层问题的层次结构来整合不同模式的专家交互。我们的框架可以在不同层级结合不同的模仿学习(IL)与强化学习(RL)组合,从而大幅减少专家投入与探索代价。利用包括 Montezuma's Revenge 在内的长跨度基准,我们证明了我们的方法比分层 RL 学习显著更快,且比标准 IL 显著更节省标注。我们还从理论角度分析了框架某些实例的标注代价。
引用
@article{arxiv.1803.00590,
title = {Hierarchical Imitation and Reinforcement Learning},
author = {Hoang M. Le and Nan Jiang and Alekh Agarwal and Miroslav Dudík and Yisong Yue and Hal Daumé},
journal= {arXiv preprint arXiv:1803.00590},
year = {2018}
}
备注
Proceedings of the 35th International Conference on Machine Learning (ICML 2018)