中文

非平稳重尾 Bandit 中用于遗憾最小化的 Catoni 风格变点检测

机器学习 2025-05-27 v1

摘要

在过去十年中,随机非平稳 Bandit 中的遗憾最小化因其能够建模从广告到推荐系统的广泛现实问题而受到欢迎。现有文献依赖于对奖励生成过程的各种假设,例如伯努利或次高斯奖励。然而,在金融和电信等环境中,重尾分布自然出现。在本研究中,我们处理重尾分段平稳 Bandit 问题。由 Bubeck 等人于 2013 年引入的重尾 Bandit 在最弱假设下运行,即最大阶 1+ϵ1+\epsilon 的有限绝对中心矩被常数 v<+v<+\infty 一致有界,其中 ϵ(0,1]\epsilon \in (0,1]。我们关注最流行的非平稳 Bandit 设置,即分段平稳设置,其中奖励生成分布的均值可能在未知时间步发生变化。我们提出了一种针对重尾分布量身定制的 Catoni 风格变点检测策略,该策略依赖于序贯估计理论的最新进展,具有独立的意义。我们引入了 Robust-CPD-UCB,它将此变点检测策略与 Bandit 的乐观算法相结合,提供了其遗憾上界以及关于任何策略最小可达遗憾的不可能性结果。最后,我们通过在合成和真实数据集上的数值实验验证了我们的方法。

关键词

引用

@article{arxiv.2505.20051,
  title  = {Catoni-Style Change Point Detection for Regret Minimization in Non-Stationary Heavy-Tailed Bandits},
  author = {Gianmarco Genalti and Sujay Bhatt and Nicola Gatti and Alberto Maria Metelli},
  journal= {arXiv preprint arXiv:2505.20051},
  year   = {2025}
}