中文

图结构赌博机的最优策略

信息论 2020-07-13 v2 math.IT 机器学习

摘要

我们研究多臂赌博机问题的一个结构化变体,其由一组伯努利分布 ν ⁣= ⁣(ν_a,b)_aA,bB \nu \!= \!(\nu\_{a,b})\_{a \in \mathcal{A}, b \in \mathcal{B}}(均值为 (μ_a,b)_aA,bB ⁣ ⁣[0,1]A×B(\mu\_{a,b})\_{a \in \mathcal{A}, b \in \mathcal{B}}\!\in\![0,1]^{\mathcal{A}\times\mathcal{B}})以及给定权重矩阵 ω ⁣= ⁣(ω_b,b)_b,bB\omega\!=\! (\omega\_{b,b'})\_{b,b' \in \mathcal{B}} 指定,其中 A \mathcal{A} 为有限的臂集合,B \mathcal{B} 为有限的用户集合。权重矩阵 ω\omega 满足对任意两个用户 b,b ⁣ ⁣B,max_aAμ_a,b ⁣ ⁣μ_a,b ⁣ ⁣ω_b,bb,b'\!\in\!\mathcal{B}, \text{max}\_{a\in\mathcal{A}}|\mu\_{a,b} \!-\! \mu\_{a,b'}| \!\leq\! \omega\_{b,b'} 。该表述足够灵活,可涵盖多种情形,从高度结构化场景(ω ⁣ ⁣{0,1}B×B\omega\!\in\!\{0,1\}^{\mathcal{B}\times\mathcal{B}})到完全非结构化设置(ω ⁣ ⁣1\omega\!\equiv\! 1)。我们根据学习器是仅选择动作来采样奖励还是同时选择用户和动作,考虑两种场景。我们首先推导了该通用图结构下关于后悔值的依赖问题的下界,其涉及一个结构相关的线性规划问题。其次,我们将 Honda 和 Takemura(2015)提出的索引最小经验散度(IMED)算法适配于该设定,并引入 IMED-GS^\star 算法。有趣的是,IMED-GS^\starTT 步后无需计算线性规划问题的解超过约 log(T)\log(T) 次,同时被证明是渐近最优的。此外,与现有为其他流行结构设计的赌博机策略不同,IMED-GS^\star 不借助显式强制探索机制,仅利用经验事件的局部计数。我们最后提供了数值实验以印证我们的结果,证实了 IMED-GS^\star 的性能。

关键词

引用

@article{arxiv.2007.03224,
  title  = {Optimal Strategies for Graph-Structured Bandits},
  author = {Hassan Saber and Pierre Ménard and Odalric-Ambrym Maillard},
  journal= {arXiv preprint arXiv:2007.03224},
  year   = {2020}
}