中文

随机_bandit 中的后悔分布:期望与尾部风险间的最优权衡

机器学习 2025-10-27 v2 机器学习 统计理论 统计方法学 统计理论

摘要

我们研究随机多臂_bandit 模型中后悔分布的期望与尾部风险之间的最优权衡。我们完整刻画了策略设计上三个期望性质之间的相互作用:最坏情况最优性、实例依赖一致性与轻尾风险。我们提出新策略以刻画任意后悔阈值下的最优后悔尾概率。特别地,我们发现最优尾速率存在一个内在差距,取决于时间范围 TT 是否先验已知。有趣的是,在纯最坏情况场景下该差距消失。我们的结果揭示了如何设计在效率与安全间平衡的策略的见解,并凸显了关于策略超参数与模型误设的策略鲁棒性的额外见解。我们还进行了仿真研究以验证理论见解,并对策略给出实际修正。最后,我们讨论结果向(i)一般次指数环境与(ii)一般随机线性_bandit 的推广。此外,我们发现所提策略设计的一个特例竟与 AlphaGo 蒙特卡洛树搜索中所采用的巧合。我们的理论为为何其工程化方案成功提供了高层见解,并应在复杂决策环境中予以倡导。

关键词

引用

@article{arxiv.2304.04341,
  title  = {Regret Distribution in Stochastic Bandits: Optimal Trade-off between Expectation and Tail Risk},
  author = {David Simchi-Levi and Zeyu Zheng and Feng Zhu},
  journal= {arXiv preprint arXiv:2304.04341},
  year   = {2025}
}