利用连续生物标志物分布的尾部分位数进行二元疾病预测
统计方法学
2021-03-24 v1 机器学习
定量方法
摘要
在二元疾病分类分析中,单一生物标志物可能不具备显著的判别力,应从一大组生物标志物中筛选多个生物标志物。现有众多方法,但它们仅对病例与对照间生物标志物的均值差异表现良好。然而生物过程异质性更强,差异亦可能出现在其他分布特征中(如方差、偏度)。许多机器学习技术更能利用这些高阶分布差异,有时以可解释性为代价。本研究提出基于分位数的预测(QBP),一种基于多个连续生物标志物筛选的二元分类方法。QBP 利用病例与对照生物标志物分布的尾部生成单一评分。该单一评分随后可通过 ROC 分析评估其预测能力。QBP 的性能通过广泛的模拟研究以及与有监督学习方法的比较得以评估,并应用于两项案例研究:重度抑郁症与三体综合征。同时,评估了现有技术彼此间的分类性能。QBP 的关键优势在于筛选相关生物标志物的能力,以及在生物标志物主要呈现病例与对照间方差差异时出色的分类性能。当生物标志物仅存在均值偏移时,QBP 性能较差。最后,QBP 在缺乏疾病相关生物标志物时证明是无偏的,并在 MDD 案例研究中优于其他方法。需进一步研究以优化 QBP,因其存在若干提升性能的契机。在此我们意在引入 QBP 的原理并展示其潜力。
引用
@article{arxiv.2103.12409,
title = {Binary disease prediction using tail quantiles of the distribution of continuous biomarkers},
author = {Michiel H. J. Paus and Edwin R. van den Heuvel and Marc J. M. Meddens},
journal= {arXiv preprint arXiv:2103.12409},
year = {2021}
}
备注
26 pages, 5 figures