社交网络上的随机多臂老虎机协作学习
机器学习
2016-07-12 v2 机器学习
摘要
我们考虑一种协作式在线学习范式,其中一群通过社交网络连接的智能体参与游玩随机多臂老虎机游戏。每当一个智能体采取动作时,相应的奖励会瞬时被该智能体及其在社交网络中的邻居观测到。我们在该协作学习设定下对多种策略进行了后悔分析。本文的一个关键发现是,将广泛研究的单智能体学习策略自然扩展到网络设定时,其在后悔方面未必表现良好。特别地,我们识别出一类非利他且个体一致的策略,并通过推导后悔下界论证它们在网络设定下易于遭受较大的后悔。我们还表明,如果智能体利用网络的结构,学习性能可得到实质性提升,并基于网络的支配集开发了一种简单的学习算法。具体而言,我们首先考虑星型网络——层级社交网络中的常见模体——并从解析上证明中心智能体可用作信息汇以加速学习并改善整体后悔。我们还推导了该算法应用于一般网络时的全网后悔界。我们在多种网络上进行数值实验以证实我们的解析结果。
引用
@article{arxiv.1602.08886,
title = {Collaborative Learning of Stochastic Bandits over a Social Network},
author = {Ravi Kumar Kolla and Krishna Jagannathan and Aditya Gopalan},
journal= {arXiv preprint arXiv:1602.08886},
year = {2016}
}
备注
14 Pages, 6 Figures