批量线性上下文赌博机的近乎最优批量-遗憾权衡
机器学习
2022-10-18 v3
摘要
我们研究了批量线性上下文赌博机的最优批量-遗憾权衡。对于任意批量数、动作数、时间范围和维度,我们提供了一个算法并证明了其遗憾界,由于技术原因,该遗憾界随着时间范围的增长呈现两阶段表达式。我们还证明了一个下界定理,该定理令人惊讶地表明,我们的两阶段遗憾上界(在对数因子范围内)在问题参数的*整个范围*内都是最优的,从而确立了精确的批量-遗憾权衡。与近期工作\citep{ruan2020linear}相比,该工作表明个批次足以在没有批量约束的情况下实现渐近极小极大最优遗憾,我们的算法更简单,更易于实际实现。此外,我们的算法对所有都能实现最优遗憾,而\citep{ruan2020linear}要求大于一个不切实际的的大多项式。在我们的分析中,我们还证明了一个新的矩阵集中不等式,该不等式依赖于其动态上界,据我们所知,这是文献中首次出现此类不等式,可能具有独立的研究价值。
引用
@article{arxiv.2110.08057,
title = {Almost Optimal Batch-Regret Tradeoff for Batch Linear Contextual Bandits},
author = {Zihan Zhang and Xiangyang Ji and Yuan Zhou},
journal= {arXiv preprint arXiv:2110.08057},
year = {2022}
}