面向广义线性上下文老虎机的双重双重稳健Thompson采样
机器学习
2023-03-02 v2 机器学习
摘要
我们提出了一种新颖的上下文老虎机算法,用于广义线性奖励,在轮内的后悔界为,其中为上下文协方差的最小特征值,为奖励方差的下界。在若干的实际情形中,我们的结果是首个不依赖Auer [2002]方法且具有阶的广义线性模型(GLM)老虎机后悔界。我们使用一种称为双重双重稳健(DDR)估计量的新估计量达到该界,它是双重稳健(DR)估计量的子类但具有更紧的误差界。Auer [2002]的方法通过丢弃观测到的奖励实现独立性,而我们的算法利用DDR估计量考虑所有上下文实现独立性。在概率间隔条件下,我们还给出了个臂的后悔界。间隔条件下的后悔界由Bastani和Bayati [2020]以及Bastani等人[2021]在上下文对所有臂公共但系数为臂特定的设定下给出。当上下文对所有臂不同但系数公共时,我们的结果是首个针对线性模型或GLM在间隔条件下的后悔界。我们使用合成数据与真实示例进行了实证研究,证明了我们算法的有效性。
引用
@article{arxiv.2209.06983,
title = {Double Doubly Robust Thompson Sampling for Generalized Linear Contextual Bandits},
author = {Wonyoung Kim and Kyungbok Lee and Myunghee Cho Paik},
journal= {arXiv preprint arXiv:2209.06983},
year = {2023}
}
备注
2023 AAAI Press Proceedings (Full paper including Appendix) Selected as an oral presentation at the 2023 AAAI conference