中文

潜在混杂因子下的上下文赌博机:一种NMF方法

机器学习 2016-10-28 v3 系统与控制 机器学习

摘要

受在线推荐和广告系统的启发,我们考虑了一个具有潜在低维混杂因子的随机上下文赌博机因果模型。在我们的模型中,有 LL 个观测上下文和 KK 个赌博机臂。观测上下文通过基数为 mm (mL,Km \ll L,K) 的潜在混杂变量影响所获得的奖励。臂的选择和潜在混杂因子因果决定奖励,而观测上下文与混杂因子相关。在该模型下,L×KL \times K 平均奖励矩阵 U\mathbf{U}(对于 [L][L] 中的每个上下文和 [K][K] 中的每个臂)分解为非负因子 A\mathbf{A} (L×mL \times m) 和 W\mathbf{W} (m×Km \times K)。这一见解使我们提出一种 ϵ\epsilon-贪婪 NMF-Bandit 算法,该算法设计了一系列干预(选择特定臂),在学习的低维结构与选择最佳臂以最小化后悔之间取得平衡。我们的算法在时间 TT 达到 O(Lpoly(m,logK)logT)\mathcal{O}\left(L\mathrm{poly}(m, \log K) \log T \right) 的后悔界,而常规上下文赌博机为 O(LKlogT)\mathcal{O}(LK\log T),假设每个上下文中最佳臂与其余臂之间存在恒定差距。这些保证是在因子的温和充分条件下获得的,这些条件是为众所周知的统计RIP条件的较弱版本。我们进一步提出了一类满足我们充分条件的生成模型,并推导了 O(KmlogT)\mathcal{O}\left(Km\log T\right) 的下界。这是当秩大于一时,带有赌博机反馈的在线矩阵补全的首个后悔保证。我们进一步在合成和真实世界数据集上将我们的算法与最先进水平进行了比较。

关键词

引用

@article{arxiv.1606.00119,
  title  = {Contextual Bandits with Latent Confounders: An NMF Approach},
  author = {Rajat Sen and Karthikeyan Shanmugam and Murat Kocaoglu and Alexandros G. Dimakis and Sanjay Shakkottai},
  journal= {arXiv preprint arXiv:1606.00119},
  year   = {2016}
}

备注

37 pages, 2 figures