分批多臂老虎机中 Thompson 采样的渐近性能
机器学习
2021-10-04 v1
摘要
我们研究了 Thompson 采样算法在分批多臂老虎机设定下的渐近性能,其中时间范围 被划分为若干批次,且智能体直到每批结束时才能观察到其动作的奖励。我们表明,在这种分批设定下,只要批大小以亚指数速度增长,Thompson 采样就能达到与每次动作后均可获得即时反馈情形相同的渐近性能。该结果意味着,即使 Thompson 采样在 个批次中接收到延迟反馈,也能保持其性能。我们进一步提出了一种自适应分批方案,在保持相同性能的同时将批次数减少到 。尽管最近若干工作已考虑过分批多臂老虎机设定,但以往结果依赖于针对分批设定定制的算法,这些算法优化批结构并在实验初期优先探索以剔除次优动作。相反,我们表明 Thompson 采样无需任何修改即可在分批设定下取得类似的渐近性能。
引用
@article{arxiv.2110.00158,
title = {Asymptotic Performance of Thompson Sampling in the Batched Multi-Armed Bandits},
author = {Cem Kalkanli and Ayfer Ozgur},
journal= {arXiv preprint arXiv:2110.00158},
year = {2021}
}
备注
This work was presented in 2021 IEEE International Symposium on Information Theory (ISIT)