方差调整的行动者 - 评论家算法
机器学习
2013-10-15 v1 机器学习
系统与控制
摘要
我们提出了一种针对马尔可夫决策过程(MDP)的行动者 - 评论家(actor-critic)框架,其目标为方差调整的期望回报。我们的评论家使用线性函数逼近,并将兼容特征(compatible features)的概念扩展至方差调整情形。我们提出了一种回合制行动者 - 评论家算法,并证明其几乎必然收敛到目标函数的局部最优点。
引用
@article{arxiv.1310.3697,
title = {Variance Adjusted Actor Critic Algorithms},
author = {Aviv Tamar and Shie Mannor},
journal= {arXiv preprint arXiv:1310.3697},
year = {2013}
}