连续 K-Max 老虎机
机器学习
2025-02-20 v1
摘要
我们研究具有连续结果分布和弱价值-索引反馈的 -Max 组合多臂老虎机问题:每个基础臂具有未知的连续结果分布,在每一轮中,学习智能体选择 个臂,获取从这 个臂中采样得到的最大值作为奖励,并观察该奖励及对应的臂索引作为反馈。该设定涵盖了推荐系统、分布式计算和服务器调度等关键应用。连续 -Max 老虎机带来了独特的挑战,包括连续到离散转换产生的离散化误差、有限反馈下的非确定性平局决胜,以及部分可观测性导致的估计偏差。我们的核心贡献是计算高效的算法 DCK-UCB,它结合了自适应离散化与偏差校正的置信界来解决这些挑战。对于一般的连续分布,我们证明 DCK-UCB 实现了 的遗憾上界,为该设定建立了首个次线性遗憾保证。此外,我们识别了一个在全老虎机反馈下具有指数分布的重要特例。在此情况下,我们提出的算法 MLE-Exp 通过极大对数似然估计实现了 的遗憾上界,达到了近极小极大最优性。
引用
@article{arxiv.2502.13467,
title = {Continuous K-Max Bandits},
author = {Yu Chen and Siwei Wang and Longbo Huang and Wei Chen},
journal= {arXiv preprint arXiv:2502.13467},
year = {2025}
}