中文

连续 K-Max 老虎机

机器学习 2025-02-20 v1

摘要

我们研究具有连续结果分布和弱价值-索引反馈的 KK-Max 组合多臂老虎机问题:每个基础臂具有未知的连续结果分布,在每一轮中,学习智能体选择 KK 个臂,获取从这 KK 个臂中采样得到的最大值作为奖励,并观察该奖励及对应的臂索引作为反馈。该设定涵盖了推荐系统、分布式计算和服务器调度等关键应用。连续 KK-Max 老虎机带来了独特的挑战,包括连续到离散转换产生的离散化误差、有限反馈下的非确定性平局决胜,以及部分可观测性导致的估计偏差。我们的核心贡献是计算高效的算法 DCK-UCB,它结合了自适应离散化与偏差校正的置信界来解决这些挑战。对于一般的连续分布,我们证明 DCK-UCB 实现了 O~(T3/4)\widetilde{\mathcal{O}}(T^{3/4}) 的遗憾上界,为该设定建立了首个次线性遗憾保证。此外,我们识别了一个在全老虎机反馈下具有指数分布的重要特例。在此情况下,我们提出的算法 MLE-Exp 通过极大对数似然估计实现了 O~(T)\widetilde{\mathcal{O}}(\sqrt{T}) 的遗憾上界,达到了近极小极大最优性。

关键词

引用

@article{arxiv.2502.13467,
  title  = {Continuous K-Max Bandits},
  author = {Yu Chen and Siwei Wang and Longbo Huang and Wei Chen},
  journal= {arXiv preprint arXiv:2502.13467},
  year   = {2025}
}