聚类马尔可夫决策过程以实现持续迁移
人工智能
2016-05-03 v4 机器学习
摘要
我们提出了多种算法,用于有效地表示一组已学习最优策略的马尔可夫决策过程(MDP),将其压缩为一个较小的源子集,以便在强化学习中进行基于策略复用的终身迁移学习。当先前任务数量庞大且衡量相似度的成本抵消了迁移收益时,这种方法是必要的。该源子集在原始 MDP 集合上构成了一个'-网',即对于每个先前的 MDP ,都存在一个源 ,其最优策略在 中的遗憾值小于 。我们的贡献如下:我们提出了 EXP-3-Transfer,这是一种原则性的策略复用算法,能在学习新 MDP 时最优地复用给定的源策略集;我们提出了一个框架,用于对先前的 MDP 进行聚类以提取源子集。该框架包含:(i) 一种定义在 MDP 上的距离 ,用于衡量 MDP 之间基于策略的相似性;(ii) 一个成本函数 ,利用 衡量特定聚类对于为 EXP-3-Transfer 生成有用源任务的效果;以及 (iii) 一种可证明收敛的算法 MHAV,用于寻找最优聚类。我们在监控领域的实验中验证了我们的算法。
引用
@article{arxiv.1311.3959,
title = {Clustering Markov Decision Processes For Continual Transfer},
author = {M. M. Hassan Mahmud and Majd Hawasly and Benjamin Rosman and Subramanian Ramamoorthy},
journal= {arXiv preprint arXiv:1311.3959},
year = {2016}
}
备注
56 pages, Working paper