中文

聚类马尔可夫决策过程以实现持续迁移

人工智能 2016-05-03 v4 机器学习

摘要

我们提出了多种算法,用于有效地表示一组已学习最优策略的马尔可夫决策过程(MDP),将其压缩为一个较小的源子集,以便在强化学习中进行基于策略复用的终身迁移学习。当先前任务数量庞大且衡量相似度的成本抵消了迁移收益时,这种方法是必要的。该源子集在原始 MDP 集合上构成了一个'ϵ\epsilon-网',即对于每个先前的 MDP MpM_p,都存在一个源 MsM^s,其最优策略在 MpM_p 中的遗憾值小于 ϵ\epsilon。我们的贡献如下:我们提出了 EXP-3-Transfer,这是一种原则性的策略复用算法,能在学习新 MDP 时最优地复用给定的源策略集;我们提出了一个框架,用于对先前的 MDP 进行聚类以提取源子集。该框架包含:(i) 一种定义在 MDP 上的距离 dVd_V,用于衡量 MDP 之间基于策略的相似性;(ii) 一个成本函数 g()g(\cdot),利用 dVd_V 衡量特定聚类对于为 EXP-3-Transfer 生成有用源任务的效果;以及 (iii) 一种可证明收敛的算法 MHAV,用于寻找最优聚类。我们在监控领域的实验中验证了我们的算法。

关键词

引用

@article{arxiv.1311.3959,
  title  = {Clustering Markov Decision Processes For Continual Transfer},
  author = {M. M. Hassan Mahmud and Majd Hawasly and Benjamin Rosman and Subramanian Ramamoorthy},
  journal= {arXiv preprint arXiv:1311.3959},
  year   = {2016}
}

备注

56 pages, Working paper