中文

面向广义线性上下文老虎机的双重双重稳健Thompson采样

机器学习 2023-03-02 v2 机器学习

摘要

我们提出了一种新颖的上下文老虎机算法,用于广义线性奖励,在TT轮内的后悔界为O~(κ1ϕT)\tilde{O}(\sqrt{\kappa^{-1} \phi T}),其中ϕ\phi为上下文协方差的最小特征值,κ\kappa为奖励方差的下界。在若干ϕ=O(d)\phi=O(d)的实际情形中,我们的结果是首个不依赖Auer [2002]方法且具有d\sqrt{d}阶的广义线性模型(GLM)老虎机后悔界。我们使用一种称为双重双重稳健(DDR)估计量的新估计量达到该界,它是双重稳健(DR)估计量的子类但具有更紧的误差界。Auer [2002]的方法通过丢弃观测到的奖励实现独立性,而我们的算法利用DDR估计量考虑所有上下文实现独立性。在概率间隔条件下,我们还给出了NN个臂的O(κ1ϕlog(NT)logT)O(\kappa^{-1} \phi \log (NT) \log T)后悔界。间隔条件下的后悔界由Bastani和Bayati [2020]以及Bastani等人[2021]在上下文对所有臂公共但系数为臂特定的设定下给出。当上下文对所有臂不同但系数公共时,我们的结果是首个针对线性模型或GLM在间隔条件下的后悔界。我们使用合成数据与真实示例进行了实证研究,证明了我们算法的有效性。

关键词

引用

@article{arxiv.2209.06983,
  title  = {Double Doubly Robust Thompson Sampling for Generalized Linear Contextual Bandits},
  author = {Wonyoung Kim and Kyungbok Lee and Myunghee Cho Paik},
  journal= {arXiv preprint arXiv:2209.06983},
  year   = {2023}
}

备注

2023 AAAI Press Proceedings (Full paper including Appendix) Selected as an oral presentation at the 2023 AAAI conference