揭示Bandit在线聚类:随机与平滑对抗上下文下的增强探索
机器学习
2025-01-03 v1 人工智能
机器学习
摘要
上下文多臂老虎机(MAB)问题在序贯决策中至关重要。一系列被称为 bandit 在线聚类的研究通过将相似用户分组为簇,利用共享特征来提高学习效率,从而扩展了上下文 MAB。然而,依赖置信上界(UCB)策略的现有算法难以收集足够的统计信息以准确识别未知的用户簇。因此,它们的理论分析要求对环境生成的上下文的“多样性”做出几个强假设,导致了不切实际的设定、复杂的分析以及较差的实际性能。去除这些假设一直是 bandit 聚类文献中长期悬而未决的问题。在本文中,我们为这一开放问题提供了两种解决方案。首先,遵循现有研究中的独立同分布(i.i.d.)上下文生成设定,我们提出了两种新算法 UniCLUB 和 PhaseUniCLUB,它们结合了增强的探索机制以加速簇识别。值得注意的是,我们的算法在获得与先前工作相当的遗憾界的同时,所需的假设大幅减弱。其次,受平滑分析框架启发,我们提出了一种更实用的设定,消除了先前研究中使用的 i.i.d. 上下文生成要求,从而增强了 bandit 在线聚类现有算法的性能。我们的技术可应用于基于图和基于集合的 bandit 聚类框架。在合成和真实数据集上的广泛评估表明,我们提出的算法始终优于现有方法。
引用
@article{arxiv.2501.00891,
title = {Demystifying Online Clustering of Bandits: Enhanced Exploration Under Stochastic and Smoothed Adversarial Contexts},
author = {Zhuohua Li and Maoli Liu and Xiangxiang Dai and John C. S. Lui},
journal= {arXiv preprint arXiv:2501.00891},
year = {2025}
}