上下文感知的策略重用
人工智能
2019-03-11 v4
摘要
迁移学习可以通过利用相关任务的策略来大幅加速新任务的强化学习。现有的策略重用工作要么只关注选择单一最佳源策略进行迁移而不考虑上下文,要么无法保证为目标任务学习到最优策略。为提高迁移效率并保证最优性,我们提出了一种称为上下文感知策略重用(Context-Aware Policy reuSe, CAPS)的新型策略重用方法,该方法支持多策略迁移。我们的方法学习何时以及哪个源策略最适合重用,以及何时终止其重用。CAPS 在源策略选择和目标任务学习方面提供了收敛性和最优性的理论保证。在基于网格的导航领域和 Pygame Learning Environment 上的实证结果表明,CAPS 显著优于其他最先进的策略重用方法。
引用
@article{arxiv.1806.03793,
title = {Context-Aware Policy Reuse},
author = {Siyuan Li and Fangda Gu and Guangxiang Zhu and Chongjie Zhang},
journal= {arXiv preprint arXiv:1806.03793},
year = {2019}
}
备注
Camera-ready version for AAMAS 2019