中文

Maillard 采样:最优的 Boltzmann 探索

机器学习 2022-03-08 v2 机器学习

摘要

Maillard (2013) 的博士论文给出了一个相当冷僻的 KK-臂 bandit 问题算法。这一鲜为人知的算法,我们称之为 Maillard 采样(MS),以\textit{闭式}计算每个臂被选择的概率,而广泛采用的工业 bandit 算法 Thompson 采样则不具备此性质。这意味着运行 MS 产生的 bandit 日志数据可直接用于反事实评估,不同于 Thompson 采样。受此优点启发,我们重访 MS 并给出改进分析,证明其达到渐近最优性与 KTlogT\sqrt{KT\log{T}} 极小极大后悔界,其中 TT 为时间 horizon,与已知的渐近最优 UCB 界相符。随后我们提出 MS 的变体 MS+^+,将其极小极大界改进至 KTlogK\sqrt{KT\log{K}}。MS+^+ 还可被调节为激进的(即更少探索)而不失渐近最优性,这是现有 bandit 算法所无的独特特性。我们的数值评估显示了 MS+^+ 的有效性。

关键词

引用

@article{arxiv.2111.03290,
  title  = {Maillard Sampling: Boltzmann Exploration Done Optimally},
  author = {Jie Bian and Kwang-Sung Jun},
  journal= {arXiv preprint arXiv:2111.03290},
  year   = {2022}
}

备注

accepted to AISTATS'22