中文

通过奖励塑形原型值函数

人工智能 2015-11-30 v1 机器学习

摘要

在本文中,我们结合任务相关奖励塑形与任务无关原型值函数,得到奖励相关原型值函数(RPVFs)。在构建 RPVFs 时,我们利用在采样阶段可用但未用于 PVF 构建的即时奖励。我们通过实验表明,基于 RPVF 的表示进行学习优于仅使用奖励塑形或 PVFs 的学习。特别地,当状态空间对称而奖励不对称时,RPVF 比 PVFs 更好地捕捉不对称性。

关键词

引用

@article{arxiv.1511.08589,
  title  = {Shaping Proto-Value Functions via Rewards},
  author = {Chandrashekar Lakshmi Narayanan and Raj Kumar Maity and Shalabh Bhatnagar},
  journal= {arXiv preprint arXiv:1511.08589},
  year   = {2015}
}