多任务强化学习的样本复杂度
机器学习
2013-09-27 v1 机器学习
摘要
在一系列强化学习任务之间迁移知识具有挑战性,并拥有许多重要应用。虽然有令人鼓舞的经验证据表明迁移可以提高后续强化学习任务的性能,但理论分析却非常少。在本文中,针对一系列强化学习任务,我们引入了一种新的多任务算法,其中每个任务都是从一组有限马尔可夫决策过程(其参数最初未知)的(未知)分布中独立采样的。对于此设定,我们在某些假设下证明,与标准单任务算法相比,由于迁移,探索的每任务样本复杂度显著降低。我们的多任务算法还具有理想的特性,即保证不会出现负迁移:在最坏情况下,其每任务样本复杂度与相应的单任务算法相当。
引用
@article{arxiv.1309.6821,
title = {Sample Complexity of Multi-task Reinforcement Learning},
author = {Emma Brunskill and Lihong Li},
journal= {arXiv preprint arXiv:1309.6821},
year = {2013}
}
备注
Appears in Proceedings of the Twenty-Ninth Conference on Uncertainty in Artificial Intelligence (UAI2013)