基于自适应策略迁移的高效深度强化学习
机器学习
2020-05-26 v3 人工智能
机器学习
摘要
迁移学习(TL)通过利用相关任务已学策略的先验知识,已展现出加速强化学习(RL)的巨大潜力。现有迁移方法要么显式计算任务间相似度,要么选择合适的源策略为目标任务提供引导式探索。然而,如何在不显式度量相似度的情况下,通过交替利用适当源策略的知识直接优化目标策略,目前尚属空白。本文提出一种新颖的策略迁移框架(PTF),利用该思想加速 RL。我们的框架通过将多策略迁移建模为选项学习问题,学习何时以及哪个源策略最适合复用为目标策略,以及何时终止复用。PTF 可轻松与现有深度 RL 方法结合。实验结果表明,在离散与连续动作空间中,它在学习效率和最终性能上显著加速了学习过程,并超越了最先进的策略迁移方法。
引用
@article{arxiv.2002.08037,
title = {Efficient Deep Reinforcement Learning via Adaptive Policy Transfer},
author = {Tianpei Yang and Jianye Hao and Zhaopeng Meng and Zongzhang Zhang and Yujing Hu and Yingfeng Cheng and Changjie Fan and Weixun Wang and Wulong Liu and Zhaodong Wang and Jiajie Peng},
journal= {arXiv preprint arXiv:2002.08037},
year = {2020}
}
备注
Accepted by IJCAI'2020