上下文赌博机的快速最优策略遗憾
机器学习
2026-04-06 v2 机器学习
摘要
我们研究不可知设定下的随机上下文赌博机问题,其目标是在不假设可实现性或不施加损失或奖励模型限制的情况下,与给定策略类中的最优策略竞争。在这项工作中,我们建立了相对于最优策略类遗憾的第一个快速率。我们提出的算法通过最小化一个悲观目标来在每一轮更新策略,该目标定义为策略值的裁剪逆倾向得分估计加上方差惩罚。通过利用策略类的熵假设和Hölderian误差界条件(边际条件的一种推广),我们实现了快速的最优策略类遗憾率,包括参数情况下的多对数率。该分析由一个针对有界鞅经验过程的序列自归一化极大不等式驱动,该不等式提供了统一的方差自适应置信界,并保证了自适应数据收集下的悲观性。
引用
@article{arxiv.2510.15483,
title = {Fast Best-in-Class Regret for Contextual Bandits},
author = {Samuel Girard and Aurelien Bibaut and Arthur Gretton and Nathan Kallus and Houssam Zenati},
journal= {arXiv preprint arXiv:2510.15483},
year = {2026}
}