中文

广播网络中的群体学习与观点扩散

机器学习 2013-09-17 v1

摘要

我们在观点扩散的背景下分析以下群体学习问题:考虑一个拥有 MM 个用户的网络,每个用户面临 NN 个选项。在离散时间设置下,每个时间步中,每个用户从 NN 个选项中选择 KK 个,并接收随机生成的奖励;这些奖励的统计特性取决于所选选项及用户自身,且对用户未知。每个用户旨在通过在线学习过程(即一系列探索(采样每个选项的回报)和利用(选择经验上较好的选项)步骤),在特定时间范围内最大化其期望总奖励。在此背景下,我们考虑两种群体学习场景:(1) 具有统一偏好的用户,以及 (2) 具有多样化偏好的用户,并考察用户应如何构建其学习过程,以便最好地从他人的决策和经验中提取信息,从而最大化自身奖励。性能通过弱遗憾(weak regret)来衡量,即用户总奖励与特定于用户的最佳单动作策略(即始终选择为该用户产生最高平均奖励的选项集)所产生的奖励之间的差值。在每种场景下,我们还考虑两种情况:(i) 用户交换完整信息,即分享他们从选择中获得的实际奖励;以及 (ii) 用户交换有限信息,例如仅分享他们的选择而不分享从这些选择中获得的奖励。

关键词

引用

@article{arxiv.1309.3697,
  title  = {Group Learning and Opinion Diffusion in a Broadcast Network},
  author = {Yang Liu and Mingyan Liu},
  journal= {arXiv preprint arXiv:1309.3697},
  year   = {2013}
}