中文

无图情形下图反馈 Bandit 的 Thompson Sampling 分析

机器学习 2018-05-24 v1 人工智能 机器学习

摘要

我们研究具有图反馈的多臂 Bandit 问题,其中决策者被允许观测所选动作的相邻动作,且图可能随时间变化并从不向决策者完全揭示。我们表明,当反馈图是无向图时,原始 Thompson Sampling 在时间范围 TT 上实现了最优(在对数因子内)后悔界 O~(β0(G)T)\tilde{O}\left(\sqrt{\beta_0(G)T}\right),其中 β0(G)\beta_0(G) 是潜在图的平均独立数。据我们所知,这是首个表明原始 Thompson Sampling 在无向图反馈 Bandit 设定中最优的结果。本文也给出了 Thompson Sampling 在有向设定中稍弱的后悔界。为填补此差距,我们提出了 Thompson Sampling 的一个变体,其在对数因子内达到了有向设定中的最优后悔界。两种算法均可高效实现,且任何时刻都不需要反馈图的知识。

关键词

引用

@article{arxiv.1805.08930,
  title  = {Analysis of Thompson Sampling for Graphical Bandits Without the Graphs},
  author = {Fang Liu and Zizhan Zheng and Ness Shroff},
  journal= {arXiv preprint arXiv:1805.08930},
  year   = {2018}
}

备注

Accepted by UAI 2018