中文

批量线性上下文赌博机的近乎最优批量-遗憾权衡

机器学习 2022-10-18 v3

摘要

我们研究了批量线性上下文赌博机的最优批量-遗憾权衡。对于任意批量数MM、动作数KK、时间范围TT和维度dd,我们提供了一个算法并证明了其遗憾界,由于技术原因,该遗憾界随着时间范围TT的增长呈现两阶段表达式。我们还证明了一个下界定理,该定理令人惊讶地表明,我们的两阶段遗憾上界(在对数因子范围内)在问题参数的*整个范围*内都是最优的,从而确立了精确的批量-遗憾权衡。与近期工作\citep{ruan2020linear}相比,该工作表明M=O(loglogT)M = O(\log \log T)个批次足以在没有批量约束的情况下实现渐近极小极大最优遗憾,我们的算法更简单,更易于实际实现。此外,我们的算法对所有TdT \geq d都能实现最优遗憾,而\citep{ruan2020linear}要求TT大于一个不切实际的dd的大多项式。在我们的分析中,我们还证明了一个新的矩阵集中不等式,该不等式依赖于其动态上界,据我们所知,这是文献中首次出现此类不等式,可能具有独立的研究价值。

关键词

引用

@article{arxiv.2110.08057,
  title  = {Almost Optimal Batch-Regret Tradeoff for Batch Linear Contextual Bandits},
  author = {Zihan Zhang and Xiangyang Ji and Yuan Zhou},
  journal= {arXiv preprint arXiv:2110.08057},
  year   = {2022}
}