Cramming 上下文多臂老虎机用于同策略统计评估
机器学习
2025-04-16 v2 统计计算
统计方法学
机器学习
摘要
我们引入了 cram 方法,作为一种通用的统计框架,用于利用由同一多臂上下文老虎机算法生成的数据集,评估该算法最终学到的策略。所提出的同策略评估方法论不同于大多数现有方法,后者主要关注上下文老虎机算法的异策略性能评估。Cramming 通过单次数据遍历利用整个老虎机序列,从而实现了统计上和计算上均高效的评估。我们证明,如果老虎机算法满足特定的稳定性条件,则在温和的正则性条件下,生成的 cram 评估估计量是一致且渐近正态的。此外,我们展示了该稳定性条件适用于常用的线性上下文老虎机算法,包括 epsilon-greedy、Thompson Sampling 和 Upper Confidence Bound 算法。利用合成数据和公开可用数据集,我们将 cramming 的经验性能与最先进方法进行了比较。结果表明,所提出的 cram 方法在保持无偏性和有效置信区间覆盖率的同時,相较于异策略评估方法将评估标准误降低了约 40%。
引用
@article{arxiv.2403.07031,
title = {Cramming Contextual Bandits for On-policy Statistical Evaluation},
author = {Zeyang Jia and Kosuke Imai and Michael Lingzhi Li},
journal= {arXiv preprint arXiv:2403.07031},
year = {2025}
}