中文

无界上下文分布上的上下文多臂赌博机

机器学习 2025-05-09 v2 机器学习

摘要

非参数上下文多臂赌博机是序贯决策问题的重要模型。在 α\alpha-Tsybakov 边际条件下,现有研究已为有界支撑建立了遗憾界 O~(T1α+1d+2)\tilde{O}\left(T^{1-\frac{\alpha+1}{d+2}}\right)。然而,对于无界上下文的最优遗憾尚未被分析。解决无界支撑上下文多臂赌博机问题的挑战在于同时实现探索-利用权衡和偏差-方差权衡。在本文中,我们解决了具有无界上下文的非参数上下文多臂赌博机问题。我们提出了两种结合 UCB 探索的最近邻方法。第一种方法使用固定的 kk。我们的分析表明,该方法在弱边际条件和相对轻尾上下文分布下达到极小极大最优遗憾。第二种方法使用自适应 kk。通过适当的数据驱动选择 kk,该方法实现了期望遗憾 O~(T1(α+1)βα+(d+2)β+T1β)\tilde{O}\left(T^{1-\frac{(\alpha+1)\beta}{\alpha+(d+2)\beta}}+T^{1-\beta}\right),其中 β\beta 是描述尾部强度的参数。该界在忽略对数因子的情况下与极小极大下界匹配,表明第二种方法近似最优。

关键词

引用

@article{arxiv.2408.09655,
  title  = {Contextual Bandits for Unbounded Context Distributions},
  author = {Puning Zhao and Rongfei Fan and Shaowei Wang and Li Shen and Qixin Zhang and Zong Ke and Tianhang Zheng},
  journal= {arXiv preprint arXiv:2408.09655},
  year   = {2025}
}