Maillard 采样:最优的 Boltzmann 探索
机器学习
2022-03-08 v2 机器学习
摘要
Maillard (2013) 的博士论文给出了一个相当冷僻的 -臂 bandit 问题算法。这一鲜为人知的算法,我们称之为 Maillard 采样(MS),以\textit{闭式}计算每个臂被选择的概率,而广泛采用的工业 bandit 算法 Thompson 采样则不具备此性质。这意味着运行 MS 产生的 bandit 日志数据可直接用于反事实评估,不同于 Thompson 采样。受此优点启发,我们重访 MS 并给出改进分析,证明其达到渐近最优性与 极小极大后悔界,其中 为时间 horizon,与已知的渐近最优 UCB 界相符。随后我们提出 MS 的变体 MS,将其极小极大界改进至 。MS 还可被调节为激进的(即更少探索)而不失渐近最优性,这是现有 bandit 算法所无的独特特性。我们的数值评估显示了 MS 的有效性。
引用
@article{arxiv.2111.03290,
title = {Maillard Sampling: Boltzmann Exploration Done Optimally},
author = {Jie Bian and Kwang-Sung Jun},
journal= {arXiv preprint arXiv:2111.03290},
year = {2022}
}
备注
accepted to AISTATS'22