用于 COVID-19 患者数据中重症类别优先化的分层 Neyman-Pearson 分类
机器学习
2023-10-02 v2 应用统计
摘要
COVID-19 具有从无症状到需要住院的疾病严重度谱。理解驱动疾病严重度的机制对于开发有效疗法和降低死亡率至关重要。获得此种理解的一种方式是使用多类分类框架,其中利用患者的生物学特征预测其严重度类别。在该严重度分类问题中,优先识别更严重的类别并控制“欠分类”错误(即患者被误分类为较轻类别)是有益的。Neyman-Pearson(NP)分类范式已被开发用于优先控制指定类型的错误。然而,当前的 NP 流程要么用于二分类,要么在多类分类中无法对优先错误提供高概率控制。在此,我们提出一种分层 NP(H-NP)框架及一种通用适配流行分类方法并以高概率控制欠分类错误的伞式算法。在一个整合的 864 名患者的单细胞 RNA-seq(scRNA-seq)数据集集合上,我们探索了特征化方式,并证明了 H-NP 算法无论特征化如何均能控制欠分类错误的有效性。除 COVID-19 严重度分类外,H-NP 算法通常适用于类别具有优先顺序的多类分类问题。
引用
@article{arxiv.2210.02197,
title = {Hierarchical Neyman-Pearson Classification for Prioritizing Severe Disease Categories in COVID-19 Patient Data},
author = {Lijia Wang and Y. X. Rachel Wang and Jingyi Jessica Li and Xin Tong},
journal= {arXiv preprint arXiv:2210.02197},
year = {2023}
}