低秩广义线性bandit问题
机器学习
2020-10-20 v2 机器学习
摘要
在低秩线性bandit问题中,一个动作(由大小为的矩阵表示)的奖励是该动作与未知低秩矩阵的内积。我们提出了一种基于在线到置信集转换~\citep{abbasi2012online}和对低秩矩阵覆盖构造的指数加权平均预测器的新颖组合的算法。在轮中,我们的算法实现了的regret,当的秩:时,优于标准线性bandit的regret界。我们还将算法方法扩展到广义线性设置,得到在链接函数正则条件下具有类似界的算法。为规避基于覆盖的方法的计算难解性,我们通过扩展~\citet{jun2019bilinear}的“先探索子空间再精炼”算法,提出了一种高效算法。我们的高效算法在动作集和的第个奇异值上的温和条件下实现了的regret。我们的上界与\cite{jun2019bilinear}推测的低秩线性bandit问题子类的下界相匹配。此外,我们表明现有的稀疏线性bandit问题下界强烈暗示我们的regret界是不可改进的。为补充我们的理论贡献,我们还进行了实验,证明当为低秩时,我们的算法可以大幅优于标准线性bandit方法的性能。
引用
@article{arxiv.2006.02948,
title = {Low-Rank Generalized Linear Bandit Problems},
author = {Yangyi Lu and Amirhossein Meisami and Ambuj Tewari},
journal= {arXiv preprint arXiv:2006.02948},
year = {2020}
}