线性 logistic 模型的改进置信界及其在线性 bandit 中的应用
机器学习
2022-06-22 v2 机器学习
摘要
我们提出针对线性 logistic 模型的改进固定设计置信界。借助 logistic 损失自和谐分析的最新进展(Faury 等,2020),我们的界相比 Li 等(2017)的最先进界有显著改进。具体而言,我们的置信界避免对 的直接依赖,其中 为所有臂奖赏分布的最小方差。一般地, 随未知线性参数 的范数呈指数缩放。我们的置信界不依赖此最坏情形量,而是对任意给定臂的奖赏直接依赖于该臂奖赏分布的方差。我们给出新界在纯探索与遗憾最小化 logistic bandit 中的两种应用,改进了最先进的性能保证。对于纯探索,我们还提供一个下界,凸显了一类实例对 的依赖。
引用
@article{arxiv.2011.11222,
title = {Improved Confidence Bounds for the Linear Logistic Model and Applications to Linear Bandits},
author = {Kwang-Sung Jun and Lalit Jain and Blake Mason and Houssam Nassif},
journal= {arXiv preprint arXiv:2011.11222},
year = {2022}
}