中文

马尔可夫决策过程中的离屏风险评估

机器学习 2022-09-22 v1 人工智能 机器学习

摘要

出于与安全对齐人类偏好以及学习效率等各异目标,越来越多的强化学习研究关注依赖于回报整个分布的风险泛函。近期关于上下文老虎机离屏风险评估(OPRA)的工作引入了目标策略回报累积分布函数(CDF)的一致估计量,并给出了有限样本保证,该保证可推广至(且同时成立地覆盖)所有风险。本文将OPRA提升至马尔可夫决策过程(MDPs),其中重要性采样(IS)的CDF估计量因有效样本量小,在较长轨迹上方差很高。为缓解这些问题,我们引入基于模型的估计,开发了MDP中回报CDF的首个双重稳健(DR)估计量。该估计量方差显著更小,且当模型设定良好时达到Cramer-Rao方差下界。此外,对许多风险泛函,下游估计同时具有更低偏差与更低方差。我们还推导了离屏CDF与风险估计的首个极小极大下界,其与我们的误差界仅差常数因子。最后,我们在多个不同环境上通过实验展示了DR CDF估计的精度。

关键词

引用

@article{arxiv.2209.10444,
  title  = {Off-Policy Risk Assessment in Markov Decision Processes},
  author = {Audrey Huang and Liu Leqi and Zachary Chase Lipton and Kamyar Azizzadenesheli},
  journal= {arXiv preprint arXiv:2209.10444},
  year   = {2022}
}