中文

具有Bandit反馈的最优聚类

机器学习 2024-05-16 v2 信息论 math.IT 机器学习

摘要

本文考虑具有bandit反馈的在线聚类问题。一组臂(或物品)可以被划分为若干未知组。在每个组内,与每个臂相关的观测遵循具有相同均值向量的同一分布。在每一步,智能体查询或拉动一个臂,并从其相关分布获得独立观测。后续的拉动依赖于先前的拉动以及先前获得的样本。智能体的任务是以最少的臂拉动次数揭示臂的底层划分,且错误概率不超过给定常数δ\delta。所提问题在从病毒变体聚类到在线市场细分等众多领域有广泛应用。我们给出了该任务期望样本复杂度的实例相关信息论下界,并设计了一个计算高效且渐近最优的算法,即Bandit在线聚类(BOC)。该算法包含一种用于自适应序贯检验的新颖停止规则,避免了将其任何NP难加权聚类问题作为子程序精确求解的需要。我们通过合成和真实世界数据集上的大量仿真表明,BOC的性能渐近匹配下界,并显著优于非自适应基线算法。

关键词

引用

@article{arxiv.2202.04294,
  title  = {Optimal Clustering with Bandit Feedback},
  author = {Junwen Yang and Zixin Zhong and Vincent Y. F. Tan},
  journal= {arXiv preprint arXiv:2202.04294},
  year   = {2024}
}

备注

54 pages, 4 figures