中文

分批多臂老虎机中 Thompson 采样的渐近性能

机器学习 2021-10-04 v1

摘要

我们研究了 Thompson 采样算法在分批多臂老虎机设定下的渐近性能,其中时间范围 TT 被划分为若干批次,且智能体直到每批结束时才能观察到其动作的奖励。我们表明,在这种分批设定下,只要批大小以亚指数速度增长,Thompson 采样就能达到与每次动作后均可获得即时反馈情形相同的渐近性能。该结果意味着,即使 Thompson 采样在 ω(logT)\omega(\log T) 个批次中接收到延迟反馈,也能保持其性能。我们进一步提出了一种自适应分批方案,在保持相同性能的同时将批次数减少到 Θ(logT)\Theta(\log T)。尽管最近若干工作已考虑过分批多臂老虎机设定,但以往结果依赖于针对分批设定定制的算法,这些算法优化批结构并在实验初期优先探索以剔除次优动作。相反,我们表明 Thompson 采样无需任何修改即可在分批设定下取得类似的渐近性能。

关键词

引用

@article{arxiv.2110.00158,
  title  = {Asymptotic Performance of Thompson Sampling in the Batched Multi-Armed Bandits},
  author = {Cem Kalkanli and Ayfer Ozgur},
  journal= {arXiv preprint arXiv:2110.00158},
  year   = {2021}
}

备注

This work was presented in 2021 IEEE International Symposium on Information Theory (ISIT)