保形离屏预测
机器学习
2023-02-10 v2 机器学习
摘要
离屏评估在诸多需在新策略上线部署前离线评估的应用中至关重要。多数现有方法聚焦于期望回报,通过平均定义目标参数且仅提供点估计量。本文中,我们提出一种新颖流程,可针对目标策略从任意初始状态出发的回报构建可靠的区间估计量。我们的方案考虑了回报在其期望周围的变异性,关注个体效应并提供有效的不确定性量化。我们的核心思想在于设计一个伪策略,使其生成的子样本如同从目标策略中采样,从而现有保形预测算法可应用于预测区间的构建。我们的方法由理论、合成数据及来自短视频平台的真实数据所佐证。
引用
@article{arxiv.2206.06711,
title = {Conformal Off-policy Prediction},
author = {Yingying Zhang and Chengchun Shi and Shikai Luo},
journal= {arXiv preprint arXiv:2206.06711},
year = {2023}
}
备注
This paper is accepted at the 26th International Conference on Artificial Intelligence and Statistics (AISTATS 2023)