学习利用塑造奖励:一种奖励塑造新方法
机器学习
2020-11-06 v1 人工智能
摘要
奖励塑造是一种将领域知识引入强化学习(RL)的有效技术。诸如基于势的奖励塑造等现有方法通常充分利用给定的塑造奖励函数。然而,由于人类认知偏差等原因,人类知识向数值奖励值的转化常不完美,完全利用塑造奖励函数可能无法改善 RL 算法的性能。在本文中,我们考虑自适应利用给定塑造奖励函数的问题。我们将塑造奖励的利用表述为一个双层优化问题,其中下层是使用塑造奖励优化策略,上层是优化一个参数化塑造权重函数以最大化真实奖励。我们形式化推导了期望真实奖励相对于塑造权重函数参数的梯度,并相应提出基于不同假设的三种学习算法。在稀疏奖励 cartpole 和 MuJoCo 环境中的实验表明,我们的算法能充分利用有益的塑造奖励,同时忽略无益的塑造奖励甚至将其转化为有益的。
引用
@article{arxiv.2011.02669,
title = {Learning to Utilize Shaping Rewards: A New Approach of Reward Shaping},
author = {Yujing Hu and Weixun Wang and Hangtian Jia and Yixiang Wang and Yingfeng Chen and Jianye Hao and Feng Wu and Changjie Fan},
journal= {arXiv preprint arXiv:2011.02669},
year = {2020}
}
备注
Accepted by NeurIPS2020