序贯社区众数估计
机器学习
2021-11-17 v1 机器学习
摘要
我们考虑一个被划分为若干社区的总体,并研究通过序贯随机采样个体来识别总体中最大社区的问题。存在多个采样域,称为\emph{盒子},它们同样划分总体。每个盒子可能由不同社区的个体组成,而每个社区又可能分布在多个盒子中。学习智能体可随时从任意选定盒子中(有放回地)采样一个随机个体;采样后,智能体得知被采样个体所属社区,以及该个体此前是否被采样过。智能体的目标是在\emph{固定预算}设定下,通过优化采样策略与决策规则,最小化误识别最大社区的概率。我们提出并分析了该问题的新算法,并建立了任意算法下错误概率的信息论下界。在若干感兴趣的情形中,我们所提算法的错误概率指数衰减率被证明在常数因子内是最优的。所提算法还在真实世界数据集上通过仿真进一步验证。
引用
@article{arxiv.2111.08535,
title = {Sequential Community Mode Estimation},
author = {Shubham Anand Jain and Shreyas Goenka and Divyam Bapna and Nikhil Karamchandani and Jayakrishnan Nair},
journal= {arXiv preprint arXiv:2111.08535},
year = {2021}
}
备注
Presented in part at Performance'21. Full version in Elsevier Performance Evaluation, Dec. 21