中文

通过矩阵草图实现高效线性_bandits

机器学习 2022-03-22 v3 机器学习

摘要

我们证明两种流行的线性上下文_bandit算法OFUL和Thompson Sampling可使用Frequent Directions(一种确定性在线草图技术)变得高效。更确切地说,我们展示大小为mm的草图允许两种算法具有O(md)\mathcal{O}(md)的更新时间,而非草图版本通常所需的Ω(d2)\Omega(d^2)(其中dd为上下文向量的维度)。这种计算加速伴随着OFUL为(1+εm)3/2dT(1+\varepsilon_m)^{3/2}d\sqrt{T}量级、Thompson Sampling为((1+εm)d)3/2T\big((1+\varepsilon_m)d\big)^{3/2}\sqrt{T}量级的后悔界,其中εm\varepsilon_m由草图未覆盖的尾部特征值之和界定。特别地,当所选上下文张成的子空间维度至多为mm时,我们的算法具有与其较慢的非草图对应算法相匹配的后悔界。在真实世界数据集上的实验证实了我们的理论结果。

关键词

引用

@article{arxiv.1809.11033,
  title  = {Efficient Linear Bandits through Matrix Sketching},
  author = {Ilja Kuzborskij and Leonardo Cella and Nicolò Cesa-Bianchi},
  journal= {arXiv preprint arXiv:1809.11033},
  year   = {2022}
}