面向高置信策略评估的可容许奖励定义
机器学习
2019-05-31 v1 机器学习
摘要
在具有有限批量数据的实际应用中,强化学习(RL)的一个关键障碍是定义一种奖励函数,该函数既能反映我们对任务合理行为的隐式认知,又允许稳健的离屏策略评估。在这项工作中,我们开发了一种方法来识别策略的奖励函数可容许集,这些策略(a)与过去行为偏离不太远,且(b)在仅给定一组过去轨迹的情况下能够以高置信度评估。 together,这些确保我们提出的策略是我们有信心在高风险环境中实施的。我们在合成领域以及重症监护背景下展示了我们的奖励设计方法,针对一个整合临床目标的奖励,以学习用于将患者从机械通气中脱机的策略。
引用
@article{arxiv.1905.13167,
title = {Defining Admissible Rewards for High Confidence Policy Evaluation},
author = {Niranjani Prasad and Barbara E Engelhardt and Finale Doshi-Velez},
journal= {arXiv preprint arXiv:1905.13167},
year = {2019}
}