中文

面向线性收益的双重稳健 Thompson 采样

机器学习 2023-05-02 v3 机器学习

摘要

多臂赌博机问题的一个挑战在于,仅能观测到所选臂的随机奖励,而其他臂的奖励仍然缺失。臂的选择对过去上下文与奖励对的依赖使遗憾分析更为复杂。我们提出一种新颖的多臂上下文赌博机算法,称为双重稳健(DR)Thompson 采样,它将缺失数据文献中使用的双重稳健估计量引入带上下文的 Thompson 采样(\texttt{LinTS})。与依赖缺失数据技术的先前工作(\citet{dimakopoulou2019balanced}、\citet{kim2019doubly})不同,所提算法旨在实现一种新颖的加性遗憾分解,从而得到改进的遗憾界,其阶为 O~(ϕ2T)\tilde{O}(\phi^{-2}\sqrt{T}),其中 ϕ2\phi^2 为上下文协方差矩阵的最小特征值。这是首个使用 ϕ2\phi^2 且不含上下文维度 dd 的 \texttt{LinTS} 遗憾界。应用 ϕ2\phi^2dd 的关系,所提算法在许多实际场景中的遗憾界为 O~(dT)\tilde{O}(d\sqrt{T}),相较 \texttt{LinTS} 的界改进了 d\sqrt{d} 倍。所提方法的一个好处是它利用了所有上下文数据(无论是否被选择),从而规避了 \texttt{LinTS} 理论分析中使用的未饱和臂的技术定义。实证研究显示所提算法优于 \texttt{LinTS}。

关键词

引用

@article{arxiv.2102.01229,
  title  = {Doubly robust Thompson sampling for linear payoffs},
  author = {Wonyoung Kim and Gi-soo Kim and Myunghee Cho Paik},
  journal= {arXiv preprint arXiv:2102.01229},
  year   = {2023}
}

备注

Accepted for NeurIPS 2021 (Spotlight)