多类混合模型中分类规则的错误率控制
机器学习
2021-09-30 v1 统计理论
机器学习
统计理论
摘要
在有限混合模型的背景下,我们考虑如下问题:在控制目标类别分类错误率的同时,将尽可能多的观测值分类到这些目标类别中。类似于统计检验理论框架中的做法,可以定义不同的类 I 型和类 II 型分类错误率及其相关的最优规则,其中最优性定义为在将 I 型错误率控制在某一名义水平的前提下最小化 II 型错误率。我们首先表明,寻找最优分类规则归结为在观测空间中寻找一个最优区域,以应用经典的最大后验 (MAP) 规则。根据需要控制的误分类率,我们给出了最优区域的形状,以及在实践中计算最优分类规则的启发式方法。特别地,我们定义了一个多类 FDR 样最优规则,并将其与大多数应用中使用的阈值化 MAP 规则进行了比较。在模拟数据集和真实数据集上的结果表明,FDR 样最优规则的保守性可能显著低于阈值化 MAP 规则。
引用
@article{arxiv.2109.14235,
title = {Error rate control for classification rules in multiclass mixture models},
author = {Tristan Mary-Huard and Vittorio Perduca and Gilles Blanchard and Martin-Magniette Marie-Laure},
journal= {arXiv preprint arXiv:2109.14235},
year = {2021}
}