中文

混合模型中的误属率控制

统计理论 2023-10-26 v4 机器学习 统计理论

摘要

聚类任务在于将样本中的元素划分为同质组。多数数据集包含模糊且本质上难以归属到某一聚类的个体。然而,在实际应用中,个体误分类可能带来灾难性后果,应当避免。为使误分类率保持较小,可仅对样本的一部分进行分类。在有监督设定下,此方法广为人知并被称为带弃判选项的分类。本文将此方法置于无监督混合模型框架下重新审视,旨在开发一种能保证误属率(FMR)不超过预定义名义水平 α\alpha 的方法。我们提出一种插件过程,并给出理论分析,通过显式余项量化FMR相对于目标水平 α\alpha 的偏差。数值实验表明该过程的自助法版本可提升性能。

关键词

引用

@article{arxiv.2203.02597,
  title  = {False membership rate control in mixture models},
  author = {Ariane Marandon and Tabea Rebafka and Etienne Roquain and Nataliya Sokolovska},
  journal= {arXiv preprint arXiv:2203.02597},
  year   = {2023}
}