中文

保形离屏预测

机器学习 2023-02-10 v2 机器学习

摘要

离屏评估在诸多需在新策略上线部署前离线评估的应用中至关重要。多数现有方法聚焦于期望回报,通过平均定义目标参数且仅提供点估计量。本文中,我们提出一种新颖流程,可针对目标策略从任意初始状态出发的回报构建可靠的区间估计量。我们的方案考虑了回报在其期望周围的变异性,关注个体效应并提供有效的不确定性量化。我们的核心思想在于设计一个伪策略,使其生成的子样本如同从目标策略中采样,从而现有保形预测算法可应用于预测区间的构建。我们的方法由理论、合成数据及来自短视频平台的真实数据所佐证。

关键词

引用

@article{arxiv.2206.06711,
  title  = {Conformal Off-policy Prediction},
  author = {Yingying Zhang and Chengchun Shi and Shikai Luo},
  journal= {arXiv preprint arXiv:2206.06711},
  year   = {2023}
}

备注

This paper is accepted at the 26th International Conference on Artificial Intelligence and Statistics (AISTATS 2023)