关于风险敏感强化学习的函数逼近误差
机器学习
2019-10-23 v9
摘要
本文在目标是寻找用指数效用表示的风险敏感代价时,针对 Basu 等人提出的策略评估算法,得出了若干信息丰富的函数逼近误差界。其主要思想是利用经典的 Bapat 不等式和 Perron-Frobenius 特征向量(假设不可约 Markov 链时存在)来获得新的误差界。我们方法的创新之处在于利用 Markov 链的不可约性获得新的误差界,而 Basu 等人早期的工作使用了适用于任意矩阵的谱变差界。我们还给出了示例,其中我们所有的误差界都达到了“实际误差”,而相比之下 Basu 等人先前给出的误差界要弱得多。我们表明,这是由于先前的误差界中缺少差分项,而当状态空间较大时,该差分项在我们所有的误差界中始终存在。此外,我们讨论了我们所有误差界之间的相互比较。作为主要结果的推论,我们根据矩阵元素给出了两个不可约矩阵最大特征值之间的界。
引用
@article{arxiv.1612.07562,
title = {On the function approximation error for risk-sensitive reinforcement learning},
author = {Prasenjit Karmakar and Shalabh Bhatnagar},
journal= {arXiv preprint arXiv:1612.07562},
year = {2019}
}
备注
Improved the bound in Theorem V.4