HOPE:面向电子学习和医疗保健的以人为中心离线策略评估
机器学习
2023-02-21 v1 多智能体系统
摘要
强化学习(RL)已被广泛研究用于增强各种以人为中心任务(包括电子学习和医疗保健)中的人机交互。由于在此类任务中在线部署和评估策略风险很高,离线策略评估(OPE)对于诱导有效策略至关重要。然而,在以人为中心的环境中,OPE 具有挑战性,因为底层状态通常不可观测,且只能观测到聚合奖励(学生的考试成绩或患者最终是否出院)。在这项工作中,我们提出了一种以人为中心的 OPE(HOPE),以处理此类环境中的部分可观测性和聚合奖励。具体而言,我们考虑部分可观测性,从聚合奖励中重建即时奖励,以估计期望总回报。我们为所提方法提供了理论界限,并在真实世界的以人为中心任务(包括脓毒症治疗和智能辅导系统)中进行了广泛实验。我们的方法可靠地预测了不同策略的回报,并在标准验证方法和以人为中心的显著性测试中均优于最先进的基准。
引用
@article{arxiv.2302.09212,
title = {HOPE: Human-Centric Off-Policy Evaluation for E-Learning and Healthcare},
author = {Ge Gao and Song Ju and Markel Sanz Ausin and Min Chi},
journal= {arXiv preprint arXiv:2302.09212},
year = {2023}
}
备注
Accepted to AAMAS23