粒子价值函数
机器学习
2017-03-20 v1 人工智能
摘要
期望回报目标的策略梯度对稀有奖励的反应可能很慢。然而,在某些情况下,智能体可能希望强调低回报或高回报,而不管其概率如何。借鉴经济学和控制论文献,我们回顾了由指数效用产生的风险敏感价值函数,并通过一个例子说明了其效果。这种风险敏感价值函数并不总是适用于强化学习问题,因此我们引入了由智能体经验分布上的粒子滤波器定义的粒子价值函数,它界定了风险敏感价值函数。我们在悬崖世界中展示了该目标策略梯度的优势。
引用
@article{arxiv.1703.05820,
title = {Particle Value Functions},
author = {Chris J. Maddison and Dieterich Lawson and George Tucker and Nicolas Heess and Arnaud Doucet and Andriy Mnih and Yee Whye Teh},
journal= {arXiv preprint arXiv:1703.05820},
year = {2017}
}