多臂老虎机问题的扩展 UCB 策略
机器学习
2025-09-16 v5 概率论
统计理论
统计理论
摘要
多臂老虎机 (MAB) 问题在运筹学、随机优化和强化学习领域被广泛研究。本文考虑具有重尾奖励分布的经典 MAB 模型,并引入扩展鲁棒 UCB 策略,这是对 Bubeck 等人 [5] 和 Lattimore [22] 结果的扩展,而后者又基于 UCB 策略的开创性思想 [例如 Auer 等人 3]。先前的 UCB 策略对奖励分布要求一些严格条件,这在实际场景中难以保证。我们的扩展鲁棒 UCB 将 Lattimore 的开创性工作(针对 和 阶矩)推广到任意选择的 ,只要这两个矩具有已知的受控关系,同时仍实现最优遗憾增长阶 ,从而为具有重尾奖励分布的 UCB 策略提供了更广泛的应用领域。此外,只要奖励分布的 阶矩对某个 存在,我们在无需任何奖励分布知识的情况下实现了近最优遗憾阶。最后,我们简要介绍了我们在轻尾奖励分布方面的早期工作,以完整展示 UCB 策略惊人的简洁性和强大功能。
引用
@article{arxiv.1112.1768,
title = {Extended UCB Policies for Multi-armed Bandit Problems},
author = {Keqin Liu and Tianshuo Zheng and Zhi-Hua Zhou},
journal= {arXiv preprint arXiv:1112.1768},
year = {2025}
}
备注
32 pages, 10 figures