RASR:基于 EVaR 与熵风险的避险软鲁棒 MDPs
机器学习
2024-05-15 v2 人工智能
摘要
先前关于安全强化学习(RL)的工作分别研究了对于动力学随机性(偶然不确定性)和模型不确定性(认知不确定性)的风险规避。我们提出并分析了一个新的框架,用于在有限时域和折扣无限时域 MDPs 中联合建模与认知和偶然不确定性相关的风险。我们将这一结合风险规避(Risk-Averse)与软鲁棒(Soft-Robust)方法的框架称为 RASR。我们证明,当使用 EVaR 或熵风险来定义风险规避时,RASR 中的最优策略可以通过带有时间相关风险水平的新动态规划公式高效计算。因此,最优的风险规避策略是确定性的但时间相关的,即使在无限时域折扣设定下也是如此。我们还展示了特定的 RASR 目标可归约为带有均值后验转移概率的风险规避 RL。我们的实证结果表明,我们的新算法在由 EVaR 和其他标准风险度量所衡量的不确定性上持续得到缓解。
引用
@article{arxiv.2209.04067,
title = {RASR: Risk-Averse Soft-Robust MDPs with EVaR and Entropic Risk},
author = {Jia Lin Hau and Marek Petrik and Mohammad Ghavamzadeh and Reazul Russel},
journal= {arXiv preprint arXiv:2209.04067},
year = {2024}
}