基于多臂老虎机反馈的聚类与分布匹配通用框架
机器学习
2025-02-12 v2 信息论
math.IT
机器学习
摘要
我们发展了一个针对带有多臂老虎机反馈的聚类和分布匹配问题的通用框架。我们考虑一种 K 臂老虎机模型,其中一部分 K 臂被划分为 M 个组。每个组内的每个臂关联的随机变量遵循相同的分布。每个时间步,决策者抽取一个臂并观察其结果。后续臂抽取依赖于臂抽取及其结果的历史记录。决策者不了解各臂的分布或底层分区。任务是制定一种在平均臂抽取次数最小且错误概率不超过预定值~ 的情况下学习底层臂分区的在线算法。本文指出,寻找 M 对臂、奇数臂识别以及 K 臂属于 N 分类问题都落入我们的通用框架。我们推导了平均臂抽取次数的非渐近下界,使得任何具有错误概率不超过 的在线算法都受到限制。此外,我们发展了一个基于 Track-and-Stop 方法和 Frank-Wolfe 算法的计算高效在线算法,表明我们的算法的平均臂抽取次数在渐近上匹配下界。我们的细致分析还揭示了当 趋于零时,我们算法的平均臂抽取次数收敛到基本极限速度的一个新颖界限。
引用
@article{arxiv.2409.05072,
title = {A General Framework for Clustering and Distribution Matching with Bandit Feedback},
author = {Recep Can Yavas and Yuqi Huang and Vincent Y. F. Tan and Jonathan Scarlett},
journal= {arXiv preprint arXiv:2409.05072},
year = {2025}
}
备注
24 pages