中文

多臂老虎机问题的扩展 UCB 策略

机器学习 2025-09-16 v5 概率论 统计理论 统计理论

摘要

多臂老虎机 (MAB) 问题在运筹学、随机优化和强化学习领域被广泛研究。本文考虑具有重尾奖励分布的经典 MAB 模型,并引入扩展鲁棒 UCB 策略,这是对 Bubeck 等人 [5] 和 Lattimore [22] 结果的扩展,而后者又基于 UCB 策略的开创性思想 [例如 Auer 等人 3]。先前的 UCB 策略对奖励分布要求一些严格条件,这在实际场景中难以保证。我们的扩展鲁棒 UCB 将 Lattimore 的开创性工作(针对 p=4p=4q=2q=2 阶矩)推广到任意选择的 p>q>1p>q>1,只要这两个矩具有已知的受控关系,同时仍实现最优遗憾增长阶 O(logT)O(log T),从而为具有重尾奖励分布的 UCB 策略提供了更广泛的应用领域。此外,只要奖励分布的 pp 阶矩对某个 p>1p>1 存在,我们在无需任何奖励分布知识的情况下实现了近最优遗憾阶。最后,我们简要介绍了我们在轻尾奖励分布方面的早期工作,以完整展示 UCB 策略惊人的简洁性和强大功能。

关键词

引用

@article{arxiv.1112.1768,
  title  = {Extended UCB Policies for Multi-armed Bandit Problems},
  author = {Keqin Liu and Tianshuo Zheng and Zhi-Hua Zhou},
  journal= {arXiv preprint arXiv:1112.1768},
  year   = {2025}
}

备注

32 pages, 10 figures