Thompson 采样在 logistic 赌博机上的性能研究
机器学习
2019-05-14 v1 机器学习
摘要
我们研究 logistic 赌博机,其中奖励为二值,成功概率为 ,动作 与系数 均位于 维单位球内。尽管先前针对 logistic 赌博机算法的后悔界对斜率参数 呈指数依赖,我们建立了 Thompson 采样的一个与 无关的后悔界。具体而言,我们证明当可行动作集与可能系数向量集相同时,Thompson 采样的贝叶斯后悔为 。我们还建立了一个适用面更广的 界,其中 为最坏情形最优对数几率, 为我们所定义的新的统计量“脆弱维数”,用以刻画某一模型的最优动作在其它模型下未能满足(satisfice)的程度。我们证明脆弱维数起着本质作用:对任意 ,任何算法均无法达到 的后悔。
引用
@article{arxiv.1905.04654,
title = {On the Performance of Thompson Sampling on Logistic Bandits},
author = {Shi Dong and Tengyu Ma and Benjamin Van Roy},
journal= {arXiv preprint arXiv:1905.04654},
year = {2019}
}
备注
Accepted for presentation at the Conference on Learning Theory (COLT) 2019