中文

一种用于逻辑斯蒂_bandit遗憾最小化的实验设计方法

机器学习 2022-02-08 v1 机器学习

摘要

本文研究逻辑斯蒂_bandit的遗憾最小化问题。逻辑斯蒂_bandit的主要挑战在于降低对可能很大的问题相关常数κ\kappa的依赖,该常数在最坏情况下可随未知参数θ\theta_{\ast}的范数呈指数级增长。Abeille等人(2021)利用逻辑斯蒂函数的自和谐性消除了这一最坏情况依赖,给出了如O(dlog2(κ)μ˙Tlog(X))O(d\log^2(\kappa)\sqrt{\dot\mu T}\log(|\mathcal{X}|))的遗憾保证,其中dd为维度,TT为时间范围,μ˙\dot\mu为最优臂的方差。本文在固定臂设定下改进了该界,采用实验设计过程实现了O(dμ˙Tlog(X))O(\sqrt{d \dot\mu T\log(|\mathcal{X}|)})的极小极大遗憾。事实上,我们的遗憾界首次给出了逻辑斯蒂_bandit中更紧的实例(即间隙)相关遗憾界。我们还提出了一种新的预热采样算法,可在一般情况下显著减小遗憾中的低阶项,并证明对于某些实例它可将低阶项对κ\kappa的依赖替换为log2(κ)\log^2(\kappa)。最后,我们讨论了极大似然估计(MLE)的偏差对逻辑斯蒂_bandit问题的影响,给出了一个例子:只要使用MLE,为d2d^2的低阶遗憾(线性_bandit中为dd)可能无法改善,以及如何使用偏差校正估计量使其更接近dd

关键词

引用

@article{arxiv.2202.02407,
  title  = {An Experimental Design Approach for Regret Minimization in Logistic Bandits},
  author = {Blake Mason and Kwang-Sung Jun and Lalit Jain},
  journal= {arXiv preprint arXiv:2202.02407},
  year   = {2022}
}