改进协方差正则化判别分析用于基于EHR的疾病预测分析
机器学习
2023-03-09 v4
摘要
线性判别分析(LDA)是一种著名的特征提取与降维技术。然而,经典LDA的性能在高维度低样本量(HDLSS)数据上因不适定逆问题而显著退化。现有的HDLSS数据分类方法通常假设数据服从高斯分布,并通过正则化处理HDLSS分类问题。然而,这些假设过于严格,难以适用于许多新兴的现实应用,例如利用从极少数已确诊或未确诊目标疾病的患者收集的电子健康记录(EHR)数据进行个性化预测分析。本文中,我们修正了使用个人EHR数据和LDA分类器进行疾病预测分析的问题。为填补这一空白,本文首先研究了一个解析模型,用以理解LDA对任意分布数据进行分类的准确性。该模型给出了LDA错误率的理论上界,该上界受两个因素控制:(1)(逆)协方差矩阵估计量的统计收敛速率,以及(2)训练/测试数据集与拟合分布之间的散度。为此,我们可以通过平衡这两个因素来降低错误率,以获得更好的分类性能。据此,我们进一步提出了一种新颖的LDA分类器De-Sparse,它利用去稀疏化图形Lasso来改进LDA的估计,其性能优于为HDLSS数据开发的最先进的LDA方法。这些进展和有效性通过理论分析以及在EHR数据集上的大量实验得到了进一步证明。
引用
@article{arxiv.1610.05446,
title = {Improving Covariance-Regularized Discriminant Analysis for EHR-based Predictive Analytics of Diseases},
author = {Sijia Yang and Haoyi Xiong and Kaibo Xu and Licheng Wang and Jiang Bian and Zeyi Sun},
journal= {arXiv preprint arXiv:1610.05446},
year = {2023}
}
备注
Sijia Yang wrote the manuscript into to the current version