中文

随机多臂老虎机的 p-均损失

机器学习 2024-12-18 v1 计算机科学与博弈论

摘要

本文将社会选择论(p-Mean welfare)中的 p-均概念推广到随机多臂老虎机问题中。p-均损失定义为最优臂均值与 p-均期望奖励之差,提供了灵活的评估框架,使算法设计者能够通过调整参数 p 在公平性和效率之间进行平衡。我们的框架将包括平均累积损失和纳什损失于特例。我们引入一个简单统一的 UCB 算法(Explore-Then-UCB),实现了新的 p-均损失界。该算法包含两个阶段:精心校准的均匀探索阶段用于初始化样本均值,随后采用 Auer、Cesa-Bianchi 和 Fischer(2002)的 UCB1 算法。我们在轻度假设下证明,该算法对所有 p ≤ -1 的情形实现 p-均损失界为 O~(kT12p)\tilde{O}\left(\sqrt{\frac{k}{T^{\frac{1}{2|p|}}}}\right),其中 k 表示臂数,T 表示时间范围。当 -1<p<0 时,我们实现损失界为 O~(k1.5T12)\tilde{O}\left(\sqrt{\frac{k^{1.5}}{T^{\frac{1}{2}}}}\right)。对于 0<p≤1 的范围,我们实现 p-均损失规模为 O~(kT)\tilde{O}\left(\sqrt{\frac{k}{T}}\right),该结果在对数因子上与先前建立的下界一致(Auer 等 1995)。该结果源于 p-均损失始终大于等于平均累积损失的事实。对于纳什损失(p 接近 0 的极限),我们的统一方法不同于先前工作(Barman 等 2023),后者需要新的纳什置信界算法。值得注意的是,我们使用更一般的方法在常数因子上实现了相同的损失界。

关键词

引用

@article{arxiv.2412.10751,
  title  = {p-Mean Regret for Stochastic Bandits},
  author = {Anand Krishna and Philips George John and Adarsh Barik and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2412.10751},
  year   = {2024}
}