在线性上下文赌博机中利用良好表示
机器学习
2021-04-09 v1
摘要
线性上下文赌博机文献主要关注于为给定表示设计高效学习算法。然而,一个上下文赌博机问题可能允许多种线性表示,每种表示具有不同的特性,直接影响学习算法的后悔值。特别是,近期工作表明存在“良好”表示,可借此实现常数级问题依赖后悔。在本文中,我们首先对文献中提出的“良好”表示的不同定义进行系统分析。然后我们提出一种新颖的选择算法,能够在一组个候选表示中自适应地选择最佳表示。我们表明,后悔值确实不会差于在最佳表示上运行LinUCB所得的后悔值(至多相差一个因子)。因此,当集合中可用“良好”表示时,我们的算法实现常数级后悔。此外,我们表明,即使初始表示中没有一个是“良好”的,该算法仍可通过隐式构造“良好”表示来实现常数级后悔。最后,我们在若干标准上下文赌博机问题中实证验证了我们的理论发现。
引用
@article{arxiv.2104.03781,
title = {Leveraging Good Representations in Linear Contextual Bandits},
author = {Matteo Papini and Andrea Tirinzoni and Marcello Restelli and Alessandro Lazaric and Matteo Pirotta},
journal= {arXiv preprint arXiv:2104.03781},
year = {2021}
}