中文

内曼-皮尔逊分类:参数化方法与样本量要求

统计方法学 2020-01-30 v5 统计理论 机器学习 统计理论

摘要

二分类中的内曼-皮尔逊(NP)范式寻求在将优先的 I 类错误控制在用户指定水平 α\alpha 之下的同时,实现最小的 II 类错误的分类器。该范式自然适用于诸如重症疾病诊断和垃圾邮件检测等应用,其中人们对两类错误有明确的优先级。最近,Tong、Feng 和 Li(2018)提出了一种非参数伞形算法,该算法使所有打分型分类方法(例如逻辑回归、支持向量机、随机森林)能够以高概率满足给定的 I 类错误上界 α\alpha,且对特征和响应无需特定的分布假设。尽管该伞形算法具有通用性,它要求对类别 00(通常是更稀缺的类别,例如罕见病诊断应用中的情况)有明确的样本量下限要求。在本工作中,我们采用参数化线性判别分析(LDA)模型,提出了一种新的参数化阈值算法,该算法不需要类别 00 观测的最小样本量要求,因此适用于罕见病诊断等小样本应用。结合现有的非参数和 newly proposed 参数化阈值规则,我们提出了四种基于 LDA 的 NP 分类器,适用于低维和高维情形。在理论方面,我们证明了所提出的一个分类器的 NP oracle 不等式,其中 II 类错误的过剩速率得益于明确的参数化模型假设。此外,由于 NP 分类器涉及类别 00 观测的样本分割步骤,我们构建了一种新的自适应样本分割方案,可普遍应用于 NP 分类器,且该自适应策略降低了这些分类器的 II 类错误。

关键词

引用

@article{arxiv.1802.02557,
  title  = {Neyman-Pearson classification: parametrics and sample size requirement},
  author = {Xin Tong and Lucy Xia and Jiacheng Wang and Yang Feng},
  journal= {arXiv preprint arXiv:1802.02557},
  year   = {2020}
}

备注

44 pages