批量分层强化学习算法
人工智能
2016-03-30 v1
摘要
分层强化学习(HRL)利用时间抽象来解决大型马尔可夫决策过程(MDP)并提供可迁移的子任务策略。本文中,我们引入一种离策略 HRL 算法:分层 Q 值迭代(HQI)。我们表明,给定从平坦随机行为策略收集的固定数据集,有可能针对原始 MDP 的任意有效分层分解有效地学习递归最优策略。我们首先形式化地证明了该算法在表格型 MDP 上的收敛性。随后在 Taxi 域上的实验表明,HQI 比平坦 Q 值迭代收敛更快,且享有简便的状态抽象。此外,我们证明我们的算法能够从同一固定数据集学习不同分层结构的最优策略,从而无需重新收集数据即可进行模型比较。
引用
@article{arxiv.1603.08869,
title = {Algorithms for Batch Hierarchical Reinforcement Learning},
author = {Tiancheng Zhao and Mohammad Gowayyed},
journal= {arXiv preprint arXiv:1603.08869},
year = {2016}
}