具有Bandit反馈的最优聚类
机器学习
2024-05-16 v2 信息论
math.IT
机器学习
摘要
本文考虑具有bandit反馈的在线聚类问题。一组臂(或物品)可以被划分为若干未知组。在每个组内,与每个臂相关的观测遵循具有相同均值向量的同一分布。在每一步,智能体查询或拉动一个臂,并从其相关分布获得独立观测。后续的拉动依赖于先前的拉动以及先前获得的样本。智能体的任务是以最少的臂拉动次数揭示臂的底层划分,且错误概率不超过给定常数。所提问题在从病毒变体聚类到在线市场细分等众多领域有广泛应用。我们给出了该任务期望样本复杂度的实例相关信息论下界,并设计了一个计算高效且渐近最优的算法,即Bandit在线聚类(BOC)。该算法包含一种用于自适应序贯检验的新颖停止规则,避免了将其任何NP难加权聚类问题作为子程序精确求解的需要。我们通过合成和真实世界数据集上的大量仿真表明,BOC的性能渐近匹配下界,并显著优于非自适应基线算法。
引用
@article{arxiv.2202.04294,
title = {Optimal Clustering with Bandit Feedback},
author = {Junwen Yang and Zixin Zhong and Vincent Y. F. Tan},
journal= {arXiv preprint arXiv:2202.04294},
year = {2024}
}
备注
54 pages, 4 figures