中文

表征学习在线性 Bandit 问题中的影响

机器学习 2021-05-06 v2

摘要

我们研究表征学习如何提升 bandit 问题的效率。我们研究如下设定:同时运行 TT 个维度为 dd 的线性 bandit,且这 TT 个 bandit 任务共享一个公共的 k(d)k (\ll d) 维线性表征。对于有限动作设定,我们提出一种新算法,其 regret 为 O~(TkN+dkNT)\widetilde{O}(T\sqrt{kN} + \sqrt{dkNT}),其中 NN 为每个 bandit 运行的轮数。当 TT 足够大时,我们的算法显著优于朴素算法(独立运行 TT 个 bandit)的 O~(TdN)\widetilde{O}(T\sqrt{d N}) regret。我们还给出了 Ω(TkN+dkNT)\Omega(T\sqrt{kN} + \sqrt{dkNT}) 的 regret 下界,表明我们的算法在 poly-logarithmic 因子范围内是极小极大最优的。此外,我们将算法推广到无限动作设定,并获得了相应的 regret 界,展示了表征学习在特定区间内的益处。我们还在合成与真实世界数据上进行了实验,以阐明我们的理论发现并证明所提算法的有效性。

关键词

引用

@article{arxiv.2010.06531,
  title  = {Impact of Representation Learning in Linear Bandits},
  author = {Jiaqi Yang and Wei Hu and Jason D. Lee and Simon S. Du},
  journal= {arXiv preprint arXiv:2010.06531},
  year   = {2021}
}

备注

25 pages, 6 figures