中文

通过 Bandit 反馈聚类物品:从众多特征中寻找正确特征

机器学习 2025-03-19 v2 机器学习

摘要

我们研究基于 bandit 反馈对一组物品进行聚类的问题。每个 nn 物品由一个特征向量表征,其维度 dd 可能很大。物品被划分为两个未知组,使得同一组内的物品共享相同的特征向量。我们考虑一个序贯和自适应的设定,在每一轮中,学习者选择一个物品和一个特征,然后观察到该物品特征的带噪评估。学习者的目标是恢复物品的正确划分,同时使观察次数尽可能少。我们提供了一种算法,该算法依赖于为聚类任务寻找相关特征,并利用了 Sequential Halving 算法。以至少 1δ1-\delta 的概率,我们获得了对划分的精确恢复,并推导出所需预算的上界。此外,我们推导了一个实例相关的下界,该下界在某些相关情况下是紧致的。

关键词

引用

@article{arxiv.2503.11209,
  title  = {Clustering Items through Bandit Feedback: Finding the Right Feature out of Many},
  author = {Maximilian Graf and Victor Thuot and Nicolas Verzelen},
  journal= {arXiv preprint arXiv:2503.11209},
  year   = {2025}
}