中文

上下文_bandit中的保形离屏预测

机器学习 2022-10-27 v2 机器学习

摘要

大多数针对上下文_bandit的离屏评估方法聚焦于策略的期望结果,其通过至多仅提供渐近保证的方法进行估计。然而,在许多应用中,期望未必是性能的最佳度量,因其未捕捉结果的可变性。此外,尤其在安全关键场景中,可能需要强于渐近正确性的保证。为应对这些局限,我们考虑将保形预测新颖地应用于上下文_bandit。给定由行为策略收集的数据,我们提出\emph{保形离屏预测}(COPP),其可针对新目标策略下的结果输出可靠的预测区间。我们在不施加标准上下文_bandit设定之外任何额外假设下提供理论有限样本保证,并在合成与真实数据上实证展示COPP相较现有方法的效用。

关键词

引用

@article{arxiv.2206.04405,
  title  = {Conformal Off-Policy Prediction in Contextual Bandits},
  author = {Muhammad Faaiz Taufiq and Jean-Francois Ton and Rob Cornish and Yee Whye Teh and Arnaud Doucet},
  journal= {arXiv preprint arXiv:2206.04405},
  year   = {2022}
}

备注

Proceedings of 36th Conference on Neural Information Processing System (NeurIPS 2022)