上下文赌博机中的早停与推断
统计理论
2025-02-06 v1 最优化与控制
概率论
机器学习
统计理论
摘要
赌博机算法使用自适应采样策略顺序积累数据,为现实世界应用提供了灵活性。然而,过度采样可能代价高昂,这推动了早停方法和可靠的实验后条件推断的发展。本文研究了线性上下文赌博机中的早停方法,包括预定的和在线停止规则,以在考虑采样成本的同时最小化实验内遗憾。我们提出了基于机会成本和阈值法的停止规则,利用无偏或一致在线估计量的方差来量化所学最优策略的遗憾上界。本研究侧重于批处理设置以保证稳定性,选择批处理估计量的加权组合作为在线估计量,并推导其渐近分布。基于选定的估计量,在已实现的停止时间条件下进行在线统计推断。我们提出的方法提供了一种系统性的途径,以最小化实验内遗憾并进行稳健的实验后推断,从而促进未来应用中的决策制定。
引用
@article{arxiv.2502.02793,
title = {Early Stopping in Contextual Bandits and Inferences},
author = {Zihan Cui},
journal= {arXiv preprint arXiv:2502.02793},
year = {2025}
}