中文

PERRY:使用辅助数据的置信区间策略评估

机器学习 2025-07-29 v1 机器学习

摘要

离策略评估(OPE)方法旨在在部署前估计新强化学习(RL)策略的值。最近的进展表明,利用辅助数据集(如由生成模型合成的数据集)可提高这些价值估计的准确性。不幸的是,这些辅助数据集可能也受偏好影响,而现有方法在 RL 中使用数据增强缺乏原则性的不确定性量化。在医疗等高风险领域,可靠的不确定性估计对于比较策略价值估计至关重要。本文提出两种方法,用于在使用数据增强时构建有效的置信区间。第一种方法提供对特定初始状态 Vπ(s0)V^{\pi}(s_0) 的策略性能的置信区间——这对于人类中心的应用尤其重要。为此,我们引入一种用于高维状态 MDP 的新型保守预测方法。其次,我们考虑更常见的任务,即估计多个初始状态上的平均策略性能;为此,我们借鉴了双鲁棒估计和预测驱动推断的思想。在横向机器人、医疗和库存管理的模拟器,以及来自 MIMIC-IV 的真实医疗数据集上,我们发现我们的方法能够使用增强数据,仍能持续产生覆盖真实值的置信区间,而与之前提出的方法不同。

关键词

引用

@article{arxiv.2507.20068,
  title  = {PERRY: Policy Evaluation with Confidence Intervals using Auxiliary Data},
  author = {Aishwarya Mandyam and Jason Meng and Ge Gao and Jiankai Sun and Mac Schwager and Barbara E. Engelhardt and Emma Brunskill},
  journal= {arXiv preprint arXiv:2507.20068},
  year   = {2025}
}