线性参数化 Bandit 的近极小极大最优遗憾
机器学习
2020-08-20 v2 机器学习
摘要
我们研究具有有限动作集的线性上下文 bandit 问题。当问题维度为 、时间范围为 、且每个时间段有 个候选动作时,我们 (1) 证明对任意算法,极小极大期望遗憾为 ;(2) 引入一种变置信水平 (Variable-Confidence-Level, VCL) SupLinUCB 算法,其遗憾在上至迭代对数因子意义下与下界匹配。我们的算法结果相较先前分析节省了两次 因子,而我们的信息论下界也通过一次 因子改进了先前结果,揭示了一种与经典多臂 bandit 颇为不同的遗憾标度——后者极小极大遗憾中不含对数 项。我们的证明技术在上界方面包括变置信水平以及对 SupLinUCB 层大小的细致分析,在下界方面则包括精心构造的对抗序列以展示椭圆势引理的紧性。
引用
@article{arxiv.1904.00242,
title = {Nearly Minimax-Optimal Regret for Linearly Parameterized Bandits},
author = {Yingkai Li and Yining Wang and Yuan Zhou},
journal= {arXiv preprint arXiv:1904.00242},
year = {2020}
}