中文

低秩广义线性bandit问题

机器学习 2020-10-20 v2 机器学习

摘要

在低秩线性bandit问题中,一个动作(由大小为d1×d2d_1 \times d_2的矩阵表示)的奖励是该动作与未知低秩矩阵Θ\Theta^*的内积。我们提出了一种基于在线到置信集转换~\citep{abbasi2012online}和对低秩矩阵覆盖构造的指数加权平均预测器的新颖组合的算法。在TT轮中,我们的算法实现了O~((d1+d2)3/2rT)\widetilde{O}((d_1+d_2)^{3/2}\sqrt{rT})的regret,当Θ\Theta^*的秩:rmin{d1,d2}r \ll \min\{d_1,d_2\}时,优于标准线性bandit的regret界O~(d1d2T)\widetilde{O}(d_1d_2\sqrt{T})。我们还将算法方法扩展到广义线性设置,得到在链接函数正则条件下具有类似界的算法。为规避基于覆盖的方法的计算难解性,我们通过扩展~\citet{jun2019bilinear}的“先探索子空间再精炼”算法,提出了一种高效算法。我们的高效算法在动作集X\mathcal{X}Θ\Theta^*的第rr个奇异值上的温和条件下实现了O~((d1+d2)3/2rT)\widetilde{O}((d_1+d_2)^{3/2}\sqrt{rT})的regret。我们的上界与\cite{jun2019bilinear}推测的低秩线性bandit问题子类的下界相匹配。此外,我们表明现有的稀疏线性bandit问题下界强烈暗示我们的regret界是不可改进的。为补充我们的理论贡献,我们还进行了实验,证明当Θ\Theta^*为低秩时,我们的算法可以大幅优于标准线性bandit方法的性能。

关键词

引用

@article{arxiv.2006.02948,
  title  = {Low-Rank Generalized Linear Bandit Problems},
  author = {Yangyi Lu and Amirhossein Meisami and Ambuj Tewari},
  journal= {arXiv preprint arXiv:2006.02948},
  year   = {2020}
}