中文

强化学习中任务层次结构的自主抽取:一种序列关联规则挖掘方法

人工智能 2018-11-21 v1

摘要

强化学习(RL)技术虽然通常很强大,但可能面临学习速度慢的问题,尤其是在高维空间中。将任务分解为层次结构有潜力显著加快学习、泛化与迁移学习。然而,当前的任务分解技术通常依赖于专家提供的高层知识(例如使用动态贝叶斯网络)来抽取层次任务结构;这在自主系统中未必可得。本文提出一种基于序列关联规则挖掘的新方法,能够针对马尔可夫决策过程(MDPs)和因子化 MDPs 以自主方式抽取强化学习中的任务层次结构(SARM-HSTRL)。所提方法利用关联规则挖掘来发现不同轨迹中状态之间的因果与时间关系,并抽取出以子目标作为不同子任务终止条件来捕捉这些关系的任务层次。我们证明所抽取的层次策略在 MDPs 和因子化 MDPs 中提供层次最优策略。需注意,SARM-HSTRL 在单一任务轨迹与多任务轨迹场景下均无需动态贝叶斯网络即可抽取该层次最优策略。此外,理论与实证均表明,在适当假设下所抽取的层次任务结构与轨迹一致,并提供最有效、可靠且紧凑的结构。数值结果从子目标检测准确率、所抽取层次的有效性以及多个测试平台上的学习速度方面,将所提 SARM-HSTRL 方法与常规 HRL 算法进行比较。

关键词

引用

@article{arxiv.1811.08275,
  title  = {Autonomous Extraction of a Hierarchical Structure of Tasks in Reinforcement Learning, A Sequential Associate Rule Mining Approach},
  author = {Behzad Ghazanfari and Fatemeh Afghah and Matthew E. Taylor},
  journal= {arXiv preprint arXiv:1811.08275},
  year   = {2018}
}

备注

arXiv admin note: text overlap with arXiv:1709.04579