基于元学习的奖励塑形
机器学习
2019-01-29 v1 机器学习
摘要
奖励塑形是解决强化学习(RL)中至关重要却具挑战性的信用分配问题最有效的方法之一。然而,设计塑形函数通常需要大量专家知识与人工工程,且在面对多个相似任务待求解时困难进一步加剧。本文考虑任务分布上的奖励塑形,并提出一个通用元学习框架,在仅假设共享状态空间而不必共享动作空间的前提下,自动学习新采样任务上的高效奖励塑形。我们首先推导了无模型RL中在信用分配意义上理论最优的奖励塑形。随后提出一种基于值的元学习算法,以提取关于最优奖励塑形的有效先验。该先验可直接应用于新任务,或在少量梯度更新内可证明地适配到任务后验以求解任务。我们通过显著提升的学习效率以及跨多种设置的可解释可视化证明了我们所提塑形的有效性,其中包括从DQN到DDPG的成功迁移。
引用
@article{arxiv.1901.09330,
title = {Reward Shaping via Meta-Learning},
author = {Haosheng Zou and Tongzheng Ren and Dong Yan and Hang Su and Jun Zhu},
journal= {arXiv preprint arXiv:1901.09330},
year = {2019}
}
备注
first two authors contributed equally