中文

向邻居学习:网络中的随机与对抗性多臂老虎机

机器学习 2017-04-17 v1 社会与信息网络

摘要

个人的决策往往受到其同伴(即社交网络中的邻居)的引导。据推测,了解他人的经验有助于学习和决策,但个体通过观察邻居能获得多少优势?此类问题出现在社会学和经济学中,在本文中,我们提出了一种新颖的模型来捕捉此类决策过程,并借助经典的多臂老虎机框架对其进行分析。每个个体除了自己的行动外,还可以观察其邻居的行动和获得的奖励,并利用所有这些信息来最小化自身的遗憾(regret)。我们为这种情境提供了算法,涵盖随机和对抗性老虎机,并表明随着邻居探索程度的变化,其遗憾值平滑地在经典老虎机情境的遗憾值与完全信息情境的遗憾值之间插值。在随机情境下,只需将额外信息纳入常规的奖励估计中;而在对抗性情境下,这是通过构建一个新的无偏奖励估计器并适当界定邻居提供的额外信息量来实现的。这些算法在忽略对数因子的意义下是最优的;尽管代理独立且自私地行动,这意味着所有代理使用我们的算法构成了一个近似纳什均衡。此外,我们通过实证模拟表明,我们的算法通常显著优于可应用于此情境的现有算法。

关键词

引用

@article{arxiv.1704.04470,
  title  = {Lean From Thy Neighbor: Stochastic & Adversarial Bandits in a Network},
  author = {L. Elisa Celis and Farnood Salehi},
  journal= {arXiv preprint arXiv:1704.04470},
  year   = {2017}
}

备注

This article was first circulated in January 2015 and presented at ISMP 2015 under the title "Bandit in a Network" (https://informs.emeetingsonline.com/emeetings/formbuilder/clustersessiondtl.asp?csnno=22329&mmnno=264&ppnno=85856)