一种用于逻辑斯蒂_bandit遗憾最小化的实验设计方法
机器学习
2022-02-08 v1 机器学习
摘要
本文研究逻辑斯蒂_bandit的遗憾最小化问题。逻辑斯蒂_bandit的主要挑战在于降低对可能很大的问题相关常数的依赖,该常数在最坏情况下可随未知参数的范数呈指数级增长。Abeille等人(2021)利用逻辑斯蒂函数的自和谐性消除了这一最坏情况依赖,给出了如的遗憾保证,其中为维度,为时间范围,为最优臂的方差。本文在固定臂设定下改进了该界,采用实验设计过程实现了的极小极大遗憾。事实上,我们的遗憾界首次给出了逻辑斯蒂_bandit中更紧的实例(即间隙)相关遗憾界。我们还提出了一种新的预热采样算法,可在一般情况下显著减小遗憾中的低阶项,并证明对于某些实例它可将低阶项对的依赖替换为。最后,我们讨论了极大似然估计(MLE)的偏差对逻辑斯蒂_bandit问题的影响,给出了一个例子:只要使用MLE,为的低阶遗憾(线性_bandit中为)可能无法改善,以及如何使用偏差校正估计量使其更接近。
引用
@article{arxiv.2202.02407,
title = {An Experimental Design Approach for Regret Minimization in Logistic Bandits},
author = {Blake Mason and Kwang-Sung Jun and Lalit Jain},
journal= {arXiv preprint arXiv:2202.02407},
year = {2022}
}