中文

安全关键离线强化学习中的风险敏感死局识别

机器学习 2023-01-31 v2 机器学习

摘要

在安全关键决策场景中,能够识别最坏情况结果或死局对于在实践中制定安全可靠策略至关重要。由于环境未知或随机特性以及有限的离线训练数据,这些情况通常充满不确定性。因此,任一时刻决策的价值应基于其预期影响的分布。我们提出一个通过显式估计决策期望回报分布来识别最坏情况决策点的框架。这些估计能够以基于所设计任务风险容忍度可调的方式更早指示死局。我们在玩具域以及评估重症监护病房中重症患者达到死亡不可避免境地风险时,展示了分布死局发现(Distributional Dead-end Discovery, DistDeD)的效用。我们发现 DistDeD 显著优于先前的发现方法,平均提前 10 小时给出风险指示,并将检测率提高 20%。

关键词

引用

@article{arxiv.2301.05664,
  title  = {Risk Sensitive Dead-end Identification in Safety-Critical Offline Reinforcement Learning},
  author = {Taylor W. Killian and Sonali Parbhoo and Marzyeh Ghassemi},
  journal= {arXiv preprint arXiv:2301.05664},
  year   = {2023}
}

备注

To appear in TMLR (01/2023). The submission and reviews can be viewed at: https://openreview.net/forum?id=oKlEOT83gI