中文

上下文赌博机的快速最优策略遗憾

机器学习 2026-04-06 v2 机器学习

摘要

我们研究不可知设定下的随机上下文赌博机问题,其目标是在不假设可实现性或不施加损失或奖励模型限制的情况下,与给定策略类中的最优策略竞争。在这项工作中,我们建立了相对于最优策略类遗憾的第一个快速率。我们提出的算法通过最小化一个悲观目标来在每一轮更新策略,该目标定义为策略值的裁剪逆倾向得分估计加上方差惩罚。通过利用策略类的熵假设和Hölderian误差界条件(边际条件的一种推广),我们实现了快速的最优策略类遗憾率,包括参数情况下的多对数率。该分析由一个针对有界鞅经验过程的序列自归一化极大不等式驱动,该不等式提供了统一的方差自适应置信界,并保证了自适应数据收集下的悲观性。

关键词

引用

@article{arxiv.2510.15483,
  title  = {Fast Best-in-Class Regret for Contextual Bandits},
  author = {Samuel Girard and Aurelien Bibaut and Arthur Gretton and Nathan Kallus and Houssam Zenati},
  journal= {arXiv preprint arXiv:2510.15483},
  year   = {2026}
}