中文

Catoni 上下文赌博机对重尾奖励具有鲁棒性

机器学习 2025-02-05 v1 机器学习

摘要

典型的上下文赌博机算法假设每轮的奖励位于某个固定范围 [0,R][0, R] 内,并且其遗憾值随该奖励范围 RR 呈多项式增长。然而,许多实际场景自然涉及重尾奖励,或者最坏情况下的范围可能远大于方差。在本文中,我们基于稳健统计中的 Catoni 估计量开发了一种算法方法,并将其应用于具有一般函数逼近的上下文赌博机。当每轮奖励的方差已知时,我们使用方差加权回归方法,并建立了一个遗憾界,该界仅依赖于累积奖励方差,并与奖励范围 RR 以及轮数 TT 呈对数关系。对于方差未知的情况,我们进一步提出了一种基于仔细剥离的算法,消除了对繁琐方差估计的需求。在额外依赖于四阶矩的情况下,我们的算法同样享有基于方差的界,且对奖励范围呈对数依赖。此外,我们通过一个匹配的下界证明了我们遗憾界中主导项的最优性。

关键词

引用

@article{arxiv.2502.02486,
  title  = {Catoni Contextual Bandits are Robust to Heavy-tailed Rewards},
  author = {Chenlu Ye and Yujia Jin and Alekh Agarwal and Tong Zhang},
  journal= {arXiv preprint arXiv:2502.02486},
  year   = {2025}
}