强化学习中样本的重要性加权迁移
机器学习
2018-05-29 v1 机器学习
摘要
我们考虑强化学习(RL)中经验样本(即元组 <s, a, s', r>)的迁移,这些样本从一组源任务中收集以改进给定目标任务的学习过程。大多数相关方法侧重于选择最相关的源样本来解决目标任务,但随后所有被迁移的样本都被使用,而不再考虑任务模型之间的差异。在本文中,我们提出一种基于模型的技术,自动估计每个源样本对解决目标任务的相关性(重要性权重)。在所提方法中,所有样本都被迁移并由批强化学习(batch RL)算法用来解决目标任务,但它们对学习过程的贡献与其重要性权重成正比。通过扩展监督学习文献中给出的重要性加权结果,我们给出了所提批 RL 算法的有限样本分析。此外,我们将所提算法与 SOTA 方法进行了实证比较,表明其取得了更好的学习性能,并且对负迁移非常鲁棒,即使某些源任务与目标任务显著不同。
引用
@article{arxiv.1805.10886,
title = {Importance Weighted Transfer of Samples in Reinforcement Learning},
author = {Andrea Tirinzoni and Andrea Sessa and Matteo Pirotta and Marcello Restelli},
journal= {arXiv preprint arXiv:1805.10886},
year = {2018}
}
备注
Accepted at ICML 2018