中文

高效随机组合半老虎机的近最优遗憾界

机器学习 2025-12-30 v2 数据结构与算法 机器学习

摘要

组合多臂老虎机(CMAB)是序贯决策框架的基石,主要由两类算法主导:基于UCB的方法和诸如跟随正则化领导者(FTRL)与在线镜像下降(OMD)的对抗性方法。然而,像CUCB这类突出的基于UCB的方法会受到额外遗憾因子logT\log T的影响,这在长时间范围内是不利的,而像EXP3.M和HYBRID这样的对抗性方法则带来了显著的计算开销。为了解决这一权衡问题,我们引入了随机设置下的组合极小极大最优策略(CMOSS)。CMOSS是一种计算高效的算法,在半老虎机反馈下,当km2k\leq \frac{m}{2}时,其实现与实例无关的遗憾界为O((logk)kmT)O\big( (\log k)\sqrt{kmT}\big );当k>m2k>\frac{m}{2}时,遗憾界为O((mk)logklog(mk)T)O\big((m-k)\sqrt{\log k\log(m-k)T}\big ),其中mm是臂的数量,kk是可行动作的最大基数。至关重要的是,这一结果消除了对logT\log T的依赖,并且在kkmm的对数项范围内,匹配了当km2k\leq \frac{m}{2}Ω(kmT)\Omega\big(\sqrt{kmT}\big)和当k>m2k>\frac{m}{2}Ω((mk)log(mmk)T)\Omega\big((m-k)\sqrt{\log (\frac{m}{m-k}) T}\big)的已知下界。我们随后将分析扩展到证明CMOSS也适用于级联反馈。在合成数据集和真实世界数据集上的实验验证了CMOSS在遗憾值和运行效率上均持续优于基准算法。

关键词

引用

@article{arxiv.2508.06247,
  title  = {Near-Optimal Regret for Efficient Stochastic Combinatorial Semi-Bandits},
  author = {Zichun Ye and Runqi Wang and Xutong Liu and Shuai Li},
  journal= {arXiv preprint arXiv:2508.06247},
  year   = {2025}
}