中文

有限时间对数贝叶斯后悔上界

机器学习 2024-01-23 v3 机器学习

摘要

我们推导了贝叶斯赌博机(bandit)的首个有限时间对数贝叶斯后悔上界。在多臂赌博机中,我们针对一种上置信界(upper confidence bound)算法获得了 O(cΔlogn)O(c_\Delta \log n)O(chlog2n)O(c_h \log^2 n) 的上界,其中 chc_hcΔc_\Delta 分别是依赖于先验分布以及从该分布采样的赌博机实例间隙的常数。后一个上界渐近地匹配 Lai (1987) 的下界。我们的证明在技术上与先前工作有重大不同,同时简洁且通用。为展示我们技术的通用性,我们将其应用于线性赌博机。我们的结果揭示了在贝叶斯设定中先验的价值,无论是在目标函数中还是作为提供给学习者的侧信息。它们显著改进了现有的 O~(n)\tilde{O}(\sqrt{n}) 界,尽管 Lai (1987) 的对数下界早已存在,该界已成为文献中的标准。

关键词

引用

@article{arxiv.2306.09136,
  title  = {Finite-Time Logarithmic Bayes Regret Upper Bounds},
  author = {Alexia Atsidakou and Branislav Kveton and Sumeet Katariya and Constantine Caramanis and Sujay Sanghavi},
  journal= {arXiv preprint arXiv:2306.09136},
  year   = {2024}
}