中文

具有图反馈的随机多臂_bandit 的信息导向采样

机器学习 2017-11-10 v1 人工智能 机器学习

摘要

我们考虑具有图反馈的随机多臂 bandit 问题,其中决策者被允许观测所选动作的相邻动作。我们允许图结构随时间变化,并考虑确定性和 Erdős-Rényi 随机图模型。对于此类图反馈模型,我们首先给出了 Thompson 采样的新分析,其性能界比现有工作更紧。接下来,我们提出新的基于信息导向采样 (Information Directed Sampling, IDS) 的策略,这些策略在决策时具有图感知能力。在确定性图情形下,我们建立了所提策略的贝叶斯后悔界,其随图的团覆盖数而非动作数缩放。在随机图情形下,我们给出了所提策略的贝叶斯后悔界,其随动作数与每次迭代期望观测数之比缩放。据我们所知,这是针对随机图反馈随机 bandit 的首个解析结果。最后,通过数值评估,我们证明了所提 IDS 策略优于现有方法,包括上置信界、ϵ\epsilon-贪婪和 Exp3 算法的变体。

关键词

引用

@article{arxiv.1711.03198,
  title  = {Information Directed Sampling for Stochastic Bandits with Graph Feedback},
  author = {Fang Liu and Swapna Buccapatnam and Ness Shroff},
  journal= {arXiv preprint arXiv:1711.03198},
  year   = {2017}
}

备注

Accepted by AAAI 2018