基于状态合并变换的马尔可夫过程方差风险估计
机器学习
2019-07-12 v1 人工智能
机器学习
摘要
方差在风险敏感强化学习中起着关键作用,且大多数风险度量都可通过方差进行分析。本文以两种定律不变风险为例:均值-方差风险与指数效用风险。借助状态增广变换(SAT),我们证明了在具有基于随机转移奖励与随机化策略的马尔可夫决策过程(MDPs)中,这两种风险可被估计。为缓解状态空间膨胀,考虑到变换后转移概率的特殊结构,提出了等态状态(isotopic states)的新定义用于状态合并。在数值实验中,我们展示了 SAT 中的状态合并、朴素奖励简化带来的误差,以及 SAT 对两种风险估计的有效性。
引用
@article{arxiv.1907.05231,
title = {Variance-Based Risk Estimations in Markov Processes via Transformation with State Lumping},
author = {Shuai Ma and Jia Yuan Yu},
journal= {arXiv preprint arXiv:1907.05231},
year = {2019}
}
备注
7 pages, 7 figures, SMC 2019 accepted. arXiv admin note: text overlap with arXiv:1907.04269