马尔可夫决策过程相似性度量的分类体系
机器学习
2021-03-09 v1
摘要
尽管任务相似性的概念在课程学习或自动规划等广泛领域中具有潜在意义,但其大多与迁移学习相关联。迁移基于这样一种思想:将在一组源任务学习中所获知识重用于目标任务中的新学习过程,前提是目标与源任务足够接近。近年来,迁移学习已成功提升强化学习(RL)算法的效率(例如,通过减少达到(近)最优性能所需样本数)。RL 中的迁移基于相似性的核心概念:只要任务相似,迁移知识便可重用以解决目标任务并显著改善学习性能。因此,在构建迁移 RL 算法时,选取良好的度量以衡量这些相似性是一个关键方面,尤其当该知识从仿真迁移至真实世界时。文献中存在许多度量 MDP 间相似性的方法,因而已考虑众多相似性或其补距离的定义。在本文中,我们提出这些度量的一个分类,并依此分类分析迄今提出的相似性定义。我们还遵循该分类体系调研现有文献,并为新度量的构建指明未来方向。
引用
@article{arxiv.2103.04706,
title = {A Taxonomy of Similarity Metrics for Markov Decision Processes},
author = {Álvaro Visús and Javier García and Fernando Fernández},
journal= {arXiv preprint arXiv:2103.04706},
year = {2021}
}
备注
9 pages, submitted to IJCAI