上下文_bandit中的保形离屏预测
机器学习
2022-10-27 v2 机器学习
摘要
大多数针对上下文_bandit的离屏评估方法聚焦于策略的期望结果,其通过至多仅提供渐近保证的方法进行估计。然而,在许多应用中,期望未必是性能的最佳度量,因其未捕捉结果的可变性。此外,尤其在安全关键场景中,可能需要强于渐近正确性的保证。为应对这些局限,我们考虑将保形预测新颖地应用于上下文_bandit。给定由行为策略收集的数据,我们提出\emph{保形离屏预测}(COPP),其可针对新目标策略下的结果输出可靠的预测区间。我们在不施加标准上下文_bandit设定之外任何额外假设下提供理论有限样本保证,并在合成与真实数据上实证展示COPP相较现有方法的效用。
引用
@article{arxiv.2206.04405,
title = {Conformal Off-Policy Prediction in Contextual Bandits},
author = {Muhammad Faaiz Taufiq and Jean-Francois Ton and Rob Cornish and Yee Whye Teh and Arnaud Doucet},
journal= {arXiv preprint arXiv:2206.04405},
year = {2022}
}
备注
Proceedings of 36th Conference on Neural Information Processing System (NeurIPS 2022)