中文

预算多臂老虎机的汤普森采样

机器学习 2015-05-04 v1

摘要

汤普森采样是多臂老虎机(multi-armed bandit, MAB)最早的随机化算法之一。本文中,我们将汤普森采样扩展到预算MAB(Budgeted MAB),其中拉动一个臂有随机代价且总代价受预算约束。我们从伯努利老虎机(Bernoulli bandits)的情形开始,其中臂的随机奖励(代价)独立地从伯努利分布采样。为在此情形下实现汤普森采样算法,在每轮,我们从每个臂的奖励和代价的后验分布中采样两个数,取得其比值,选择比值最大的臂,然后更新后验分布。我们证明该算法的分布相关后悔界为 O(lnB)O(\ln B),其中 BB 表示预算。通过引入伯努利试验,我们进一步将该算法扩展到奖励(代价)从一般分布抽取的设置,并证明其后悔界几乎保持不变。我们的仿真结果证明了所提算法的有效性。

关键词

引用

@article{arxiv.1505.00146,
  title  = {Thompson Sampling for Budgeted Multi-armed Bandits},
  author = {Yingce Xia and Haifang Li and Tao Qin and Nenghai Yu and Tie-Yan Liu},
  journal= {arXiv preprint arXiv:1505.00146},
  year   = {2015}
}