具有二阶界限的改进离线上下文赌博机:押注与冻结
机器学习
2025-07-15 v2 信息论
math.IT
机器学习
摘要
我们考虑上下文赌博机中的离线策略选择与学习,其中学习者旨在利用由固定行为策略收集的数据来选择或训练一个奖励最大化的策略。我们的贡献有两方面。首先,我们提出了一种新颖的离线策略选择方法,该方法利用应用于逆倾向权重序列的基于押注的新型置信区间。我们的理论分析表明,与先前的工作相比,该方法实现了显著改进的、方差自适应的保证。其次,我们针对离线学习的优化目标提出了一种新颖且通用的条件,在偏差与方差之间取得了不同的平衡。其中一个特例我们称之为“冻结”,它倾向于产生低方差,这在数据量较小的情况下是首选的。我们的分析表明,它与现有的最佳保证相匹配。在我们的实证研究中,我们的选择方法优于现有方法,并且“冻结”在小样本机制下表现出改进的性能。
引用
@article{arxiv.2502.10826,
title = {Improved Offline Contextual Bandits with Second-Order Bounds: Betting and Freezing},
author = {J. Jon Ryu and Jeongyeol Kwon and Benjamin Koppe and Kwang-Sung Jun},
journal= {arXiv preprint arXiv:2502.10826},
year = {2025}
}
备注
39 pages, 10 figures. COLT 2025