中文

Thompson 采样在 logistic 赌博机上的性能研究

机器学习 2019-05-14 v1 机器学习

摘要

我们研究 logistic 赌博机,其中奖励为二值,成功概率为 exp(βaθ)/(1+exp(βaθ))\exp(\beta a^\top \theta) / (1 + \exp(\beta a^\top \theta)),动作 aa 与系数 θ\theta 均位于 dd 维单位球内。尽管先前针对 logistic 赌博机算法的后悔界对斜率参数 β\beta 呈指数依赖,我们建立了 Thompson 采样的一个与 β\beta 无关的后悔界。具体而言,我们证明当可行动作集与可能系数向量集相同时,Thompson 采样的贝叶斯后悔为 O~(dT)\tilde{O}(d\sqrt{T})。我们还建立了一个适用面更广的 O~(dηT/λ)\tilde{O}(\sqrt{d\eta T}/\lambda) 界,其中 λ\lambda 为最坏情形最优对数几率,η\eta 为我们所定义的新的统计量“脆弱维数”,用以刻画某一模型的最优动作在其它模型下未能满足(satisfice)的程度。我们证明脆弱维数起着本质作用:对任意 ϵ>0\epsilon > 0,任何算法均无法达到 poly(d,1/λ)T1ϵ\mathrm{poly}(d, 1/\lambda)\cdot T^{1-\epsilon} 的后悔。

关键词

引用

@article{arxiv.1905.04654,
  title  = {On the Performance of Thompson Sampling on Logistic Bandits},
  author = {Shi Dong and Tengyu Ma and Benjamin Van Roy},
  journal= {arXiv preprint arXiv:1905.04654},
  year   = {2019}
}

备注

Accepted for presentation at the Conference on Learning Theory (COLT) 2019