中文

上下文赌博机中的早停与推断

统计理论 2025-02-06 v1 最优化与控制 概率论 机器学习 统计理论

摘要

赌博机算法使用自适应采样策略顺序积累数据,为现实世界应用提供了灵活性。然而,过度采样可能代价高昂,这推动了早停方法和可靠的实验后条件推断的发展。本文研究了线性上下文赌博机中的早停方法,包括预定的和在线停止规则,以在考虑采样成本的同时最小化实验内遗憾。我们提出了基于机会成本和阈值法的停止规则,利用无偏或一致在线估计量的方差来量化所学最优策略的遗憾上界。本研究侧重于批处理设置以保证稳定性,选择批处理估计量的加权组合作为在线估计量,并推导其渐近分布。基于选定的估计量,在已实现的停止时间条件下进行在线统计推断。我们提出的方法提供了一种系统性的途径,以最小化实验内遗憾并进行稳健的实验后推断,从而促进未来应用中的决策制定。

关键词

引用

@article{arxiv.2502.02793,
  title  = {Early Stopping in Contextual Bandits and Inferences},
  author = {Zihan Cui},
  journal= {arXiv preprint arXiv:2502.02793},
  year   = {2025}
}