表征学习在线性 Bandit 问题中的影响
机器学习
2021-05-06 v2
摘要
我们研究表征学习如何提升 bandit 问题的效率。我们研究如下设定:同时运行 个维度为 的线性 bandit,且这 个 bandit 任务共享一个公共的 维线性表征。对于有限动作设定,我们提出一种新算法,其 regret 为 ,其中 为每个 bandit 运行的轮数。当 足够大时,我们的算法显著优于朴素算法(独立运行 个 bandit)的 regret。我们还给出了 的 regret 下界,表明我们的算法在 poly-logarithmic 因子范围内是极小极大最优的。此外,我们将算法推广到无限动作设定,并获得了相应的 regret 界,展示了表征学习在特定区间内的益处。我们还在合成与真实世界数据上进行了实验,以阐明我们的理论发现并证明所提算法的有效性。
引用
@article{arxiv.2010.06531,
title = {Impact of Representation Learning in Linear Bandits},
author = {Jiaqi Yang and Wei Hu and Jason D. Lee and Simon S. Du},
journal= {arXiv preprint arXiv:2010.06531},
year = {2021}
}
备注
25 pages, 6 figures