基于累积过采样的在线学习:在预算受限影响力最大化中的应用
机器学习
2020-09-17 v3 社会与信息网络
机器学习
摘要
我们提出了一种用于在线学习的累积过采样(CO)方法。我们的核心思想是在每一轮中从更新后的信念空间采样一次参数估计(类似于Thompson Sampling),并利用截至当前轮的累积样本来构造乐观参数估计,作为比标准UCB方法所构造的更紧的上置信界,其渐近地集中于真实参数附近。我们将CO应用于一种新颖的预算受限影响力最大化(IM)半赌博机问题,该问题具有边权重的线性泛化,其离线问题是NP难的。将CO与我们为离线问题设计的预言机相结合,我们的在线学习算法同时解决了预算分配、参数学习和奖励最大化。我们证明,对于IM半赌博机,我们基于CO的算法在理论上达到了与基于UCB的算法可比的缩放后悔值,并在数值实验中表现与Thompson Sampling相当。
引用
@article{arxiv.2004.11963,
title = {Online Learning with Cumulative Oversampling: Application to Budgeted Influence Maximization},
author = {Shatian Wang and Shuoguang Yang and Zhen Xu and Van-Anh Truong},
journal= {arXiv preprint arXiv:2004.11963},
year = {2020}
}