利用高斯马尔可夫随机场的强盗群
机器学习
2017-03-09 v1
摘要
强盗团伙(GOB)模型\cite{cesa2013gang}是近期一种在一组由已知(可能含噪)图相关联的强盗问题之间共享信息的上下文强盗框架。该模型在诸如推荐系统等问题中有用,其中大量用户使得在用户间传递信息至关重要。尽管有效,现有GOB模型由于其关于节点数量的二次时间依赖,只能应用于小规模问题。现有解决可扩展性问题的方案往往需要不切实际的聚类假设。通过利用与高斯马尔可夫随机场(GMRFs)的关联,我们展示了可使GOB模型在不附加假设的情况下扩展到远大于前的图。此外,我们提出了一种采用近期GMRF扰动采样技术的汤普森采样算法,使其能扩展到更大规模的问题(进而形成“强盗群”)。我们给出了采用汤普森采样和周期贪婪算法的GOB的后悔界和实验结果,表明这些方法与不利用图或采用基于聚类的方法相比效果相当或显著更优。最后,当现有图不可用时,我们提出一种启发式方法在线上学习图,并展示了有前景的结果。
引用
@article{arxiv.1703.02626,
title = {Horde of Bandits using Gaussian Markov Random Fields},
author = {Sharan Vaswani and Mark Schmidt and Laks V. S. Lakshmanan},
journal= {arXiv preprint arXiv:1703.02626},
year = {2017}
}