面向线性收益的双重稳健 Thompson 采样
机器学习
2023-05-02 v3 机器学习
摘要
多臂赌博机问题的一个挑战在于,仅能观测到所选臂的随机奖励,而其他臂的奖励仍然缺失。臂的选择对过去上下文与奖励对的依赖使遗憾分析更为复杂。我们提出一种新颖的多臂上下文赌博机算法,称为双重稳健(DR)Thompson 采样,它将缺失数据文献中使用的双重稳健估计量引入带上下文的 Thompson 采样(\texttt{LinTS})。与依赖缺失数据技术的先前工作(\citet{dimakopoulou2019balanced}、\citet{kim2019doubly})不同,所提算法旨在实现一种新颖的加性遗憾分解,从而得到改进的遗憾界,其阶为 ,其中 为上下文协方差矩阵的最小特征值。这是首个使用 且不含上下文维度 的 \texttt{LinTS} 遗憾界。应用 与 的关系,所提算法在许多实际场景中的遗憾界为 ,相较 \texttt{LinTS} 的界改进了 倍。所提方法的一个好处是它利用了所有上下文数据(无论是否被选择),从而规避了 \texttt{LinTS} 理论分析中使用的未饱和臂的技术定义。实证研究显示所提算法优于 \texttt{LinTS}。
引用
@article{arxiv.2102.01229,
title = {Doubly robust Thompson sampling for linear payoffs},
author = {Wonyoung Kim and Gi-soo Kim and Myunghee Cho Paik},
journal= {arXiv preprint arXiv:2102.01229},
year = {2023}
}
备注
Accepted for NeurIPS 2021 (Spotlight)