中文

线性参数化 Bandit 的近极小极大最优遗憾

机器学习 2020-08-20 v2 机器学习

摘要

我们研究具有有限动作集的线性上下文 bandit 问题。当问题维度为 dd、时间范围为 TT、且每个时间段有 n2d/2n \leq 2^{d/2} 个候选动作时,我们 (1) 证明对任意算法,极小极大期望遗憾为 Ω(dT(logT)(logn))\Omega(\sqrt{dT (\log T) (\log n)});(2) 引入一种变置信水平 (Variable-Confidence-Level, VCL) SupLinUCB 算法,其遗憾在上至迭代对数因子意义下与下界匹配。我们的算法结果相较先前分析节省了两次 logT\sqrt{\log T} 因子,而我们的信息论下界也通过一次 logT\sqrt{\log T} 因子改进了先前结果,揭示了一种与经典多臂 bandit 颇为不同的遗憾标度——后者极小极大遗憾中不含对数 TT 项。我们的证明技术在上界方面包括变置信水平以及对 SupLinUCB 层大小的细致分析,在下界方面则包括精心构造的对抗序列以展示椭圆势引理的紧性。

关键词

引用

@article{arxiv.1904.00242,
  title  = {Nearly Minimax-Optimal Regret for Linearly Parameterized Bandits},
  author = {Yingkai Li and Yining Wang and Yuan Zhou},
  journal= {arXiv preprint arXiv:1904.00242},
  year   = {2020}
}