通过奖励塑形原型值函数
人工智能
2015-11-30 v1 机器学习
摘要
在本文中,我们结合任务相关奖励塑形与任务无关原型值函数,得到奖励相关原型值函数(RPVFs)。在构建 RPVFs 时,我们利用在采样阶段可用但未用于 PVF 构建的即时奖励。我们通过实验表明,基于 RPVF 的表示进行学习优于仅使用奖励塑形或 PVFs 的学习。特别地,当状态空间对称而奖励不对称时,RPVF 比 PVFs 更好地捕捉不对称性。
引用
@article{arxiv.1511.08589,
title = {Shaping Proto-Value Functions via Rewards},
author = {Chandrashekar Lakshmi Narayanan and Raj Kumar Maity and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:1511.08589},
year = {2015}
}