中文

优化赌博机算法的脆弱性

机器学习 2024-11-14 v8 统计理论 机器学习 统计理论

摘要

关于赌博机算法最优设计的大量文献基于期望遗憾最小化。众所周知,在某些指数族上最优的设计可实现随臂拉动次数对数增长的期望遗憾,其速率由Lai-Robbins下界决定。本文中,我们表明当使用此类优化设计时,相应算法的遗憾分布必然具有极重尾,具体为截断Cauchy分布。此外,对 p>1p>1,遗憾分布的第 pp 矩增长远快于多对数,特别地作为臂总拉动次数的幂增长。我们表明优化的UCB赌博机设计在另一意义上也脆弱,即当下问题即便轻微误设定时,遗憾可远快于传统理论所示增长。我们的论证基于标准的测度变换思想,并指出遗憾大于预期的最可能方式是:最优臂在最初几次臂拉动中返回低于平均的奖励,从而导致算法误认该臂为次优。为缓解所暴露的脆弱性问题,我们表明UCB算法可被修改以确保对误设定具有一定鲁棒性。在此过程中,我们还展示了UCB探索量与所得遗憾分布尾部重度之间的尖锐权衡。

关键词

引用

@article{arxiv.2109.13595,
  title  = {The Fragility of Optimized Bandit Algorithms},
  author = {Lin Fan and Peter W. Glynn},
  journal= {arXiv preprint arXiv:2109.13595},
  year   = {2024}
}

备注

To appear in Operations Research