中文

具有均值与方差组合度量的风险敏感马尔可夫决策过程

最优化与控制 2020-08-11 v1 人工智能 机器学习

摘要

本文研究无限阶段离散时间马尔可夫决策过程(MDP)在综合考虑奖励均值与方差的长期平均度量下的优化问题。此类性能度量十分重要,因为均值表示平均收益而方差表示风险或公平性。然而,方差度量耦合了所有阶段的奖励,由于时间一致性原理失效,传统动态规划不适用。我们从称为基于灵敏度的优化理论的新视角研究此问题。推导了性能差分公式,其能量化任意两种不同策略下 MDP 均值-方差组合度量的差异。该差分公式可用于生成均值-方差性能严格改进的新策略。推导了最优策略的必要条件以及确定性策略的最优性。我们进一步开发了具有策略迭代形式的迭代算法,证明其能在混合和随机化策略空间中收敛到局部最优。特别地,当均值奖励在策略间为常数时,算法保证收敛到全局最优。最后,我们将该方法应用于研究储能系统中风电波动的抑制,展示了我们优化方法的潜在适用性。

关键词

引用

@article{arxiv.2008.03707,
  title  = {Risk-Sensitive Markov Decision Processes with Combined Metrics of Mean and Variance},
  author = {Li Xia},
  journal= {arXiv preprint arXiv:2008.03707},
  year   = {2020}
}

备注

43 pages, 7 figures