基于赌博机反馈的主动聚类
机器学习
2024-06-18 v1 机器学习
摘要
我们研究了主动聚类问题(ACP)。学习器与一个具有维次高斯反馈的臂随机赌博机进行交互。存在一个将臂划分为组的隐藏划分,使得同一组内的臂共享相同的均值向量。学习器的任务是以最小的预算(即最少的观测次数)并以小于指定常数的错误概率来揭示这一隐藏划分。在本文中,(i) 我们推导了预算的非渐近下界,以及(ii) 我们引入了计算高效的ACB算法,其预算在大多数情况下与该下界匹配。我们改进了均匀采样策略的性能。重要的是,与批处理设置相反,我们证明了在主动设置中不存在计算-信息差距。
引用
@article{arxiv.2406.11485,
title = {Active clustering with bandit feedback},
author = {Victor Thuot and Alexandra Carpentier and Christophe Giraud and Nicolas Verzelen},
journal= {arXiv preprint arXiv:2406.11485},
year = {2024}
}
备注
50 pages