中文

具有交叉学习的情境多臂老虎机

机器学习 2021-11-17 v3 机器学习

摘要

在经典的情境多臂老虎机问题中,在每一轮 tt,学习者观测到某个情境 cc,选择某个动作 ii 执行,并接收到某个奖励 ri,t(c)r_{i,t}(c)。我们考虑该问题的一个变体,其中除了接收到奖励 ri,t(c)r_{i,t}(c) 外,学习者还了解到对于集合 Oi(c)\mathcal{O}_i(c) 中某些其他情境 cc'ri,t(c)r_{i,t}(c') 的值;即,在不同情境 cOi(c)c'\in \mathcal{O}_i(c) 下执行该动作本可获得的奖励。这一变体出现在若干策略性场景中,例如学习如何在非真实重复拍卖中出价,近来随着许多平台转向运行首次价格拍卖,该问题备受关注。我们称此问题为具有交叉学习的情境多臂老虎机问题。针对经典情境多臂老虎机问题的最佳算法对所有平稳策略达到 O~(CKT)\tilde{O}(\sqrt{CKT}) 后悔界,其中 CC 为情境数,KK 为动作数,TT 为轮数。我们为具有交叉学习的情境多臂老虎机问题设计并分析了新算法,并表明其后悔界对情境数量的依赖更优。在完全交叉学习下,即选择动作时学到所有情境的奖励(集合 Oi(c)\mathcal{O}_i(c) 包含所有情境),我们表明我们的算法达到后悔 O~(KT)\tilde{O}(\sqrt{KT}),去除了对 CC 的依赖。对于任何其他情形,即在部分交叉学习下,对某些情境-动作对 (i,c)(i,c)Oi(c)<C|\mathcal{O}_i(c)|< C,后悔界依赖于集合 Oi(c)\mathcal O_i(c) 在多大程度上影响情境间交叉学习的可能性。我们在来自运行首次价格拍卖的广告交易平台的实际拍卖数据上模拟了我们的算法,并表明它们优于传统的情境多臂老虎机算法。

关键词

引用

@article{arxiv.1809.09582,
  title  = {Contextual Bandits with Cross-learning},
  author = {Santiago Balseiro and Negin Golrezaei and Mohammad Mahdian and Vahab Mirrokni and Jon Schneider},
  journal= {arXiv preprint arXiv:1809.09582},
  year   = {2021}
}

备注

58 pages, 4 figures