风险敏感指数代价 MDP 的策略梯度算法
系统与控制
2022-08-31 v2 系统与控制
摘要
我们研究风险敏感指数代价 MDP 形式化方法,并开发了一种基于轨迹的梯度算法,用于寻找与一组参数化策略相关的代价的驻点。我们推导出一个公式,可用于根据从 MDP 样本路径中收集的(状态、动作、代价)信息,针对每个固定的参数化策略计算策略梯度。与传统的平均代价问题不同,标准随机逼近理论无法利用该公式。为解决此问题,我们引入了风险敏感代价的截断且光滑的版本,并证明在一些温和假设下,这一新代价准则可用于一致地逼近风险敏感代价及其梯度。随后,我们开发了基于轨迹的梯度算法以最小化风险敏感代价的光滑截断估计,并推导出可使用一串截断来求解原始未截断代价问题的条件。
引用
@article{arxiv.2202.04157,
title = {A Policy Gradient Algorithm for the Risk-Sensitive Exponential Cost MDP},
author = {Mehrdad Moharrami and Yashaswini Murthy and Arghyadip Roy and R. Srikant},
journal= {arXiv preprint arXiv:2202.04157},
year = {2022}
}