中文

线性 logistic 模型的改进置信界及其在线性 bandit 中的应用

机器学习 2022-06-22 v2 机器学习

摘要

我们提出针对线性 logistic 模型的改进固定设计置信界。借助 logistic 损失自和谐分析的最新进展(Faury 等,2020),我们的界相比 Li 等(2017)的最先进界有显著改进。具体而言,我们的置信界避免对 1/κ1/\kappa 的直接依赖,其中 κ\kappa 为所有臂奖赏分布的最小方差。一般地,1/κ1/\kappa 随未知线性参数 θ\theta^* 的范数呈指数缩放。我们的置信界不依赖此最坏情形量,而是对任意给定臂的奖赏直接依赖于该臂奖赏分布的方差。我们给出新界在纯探索与遗憾最小化 logistic bandit 中的两种应用,改进了最先进的性能保证。对于纯探索,我们还提供一个下界,凸显了一类实例对 1/κ1/\kappa 的依赖。

关键词

引用

@article{arxiv.2011.11222,
  title  = {Improved Confidence Bounds for the Linear Logistic Model and Applications to Linear Bandits},
  author = {Kwang-Sung Jun and Lalit Jain and Blake Mason and Houssam Nassif},
  journal= {arXiv preprint arXiv:2011.11222},
  year   = {2022}
}