通过紧致的二到无穷奇异子空间恢复实现低秩 Bandits
机器学习
2024-07-08 v2 机器学习
摘要
我们研究具有低秩结构的上下文 Bandits,其中在每一轮中,如果选择了(上下文,臂)对 ,学习者会观察到未知低秩奖励矩阵第 个条目的噪声样本。连续的上下文以独立同分布的方式随机生成并揭示给学习者。对于此类 Bandits,我们提出了用于策略评估、最佳策略识别和遗憾最小化的高效算法。对于策略评估和最佳策略识别,我们表明我们的算法几乎是极小极大最优的。例如,以至少 的概率返回 -最优策略所需的样本数通常缩放为 。我们的遗憾最小化算法享有通常缩放为 的极小极大保证,这优于现有算法。所有提出的算法都包含两个阶段:它们首先利用谱方法估计低秩奖励矩阵的左奇异子空间和右奇异子空间。我们表明,这些估计在二到无穷范数下享有紧致的误差保证。这反过来允许我们将问题重新表述为维度约为 且误设由子空间恢复误差控制的误设线性 Bandit 问题,并高效地设计算法的第二阶段。
引用
@article{arxiv.2402.15739,
title = {Low-Rank Bandits via Tight Two-to-Infinity Singular Subspace Recovery},
author = {Yassir Jedra and William Réveillard and Stefan Stojanovic and Alexandre Proutiere},
journal= {arXiv preprint arXiv:2402.15739},
year = {2024}
}