评估基于机器学习的帕金森病生物标志物发现的可重复性
基因组学
2023-04-07 v1 机器学习
摘要
全基因组关联研究(GWAS)有助于识别患有诸如帕金森病(PD)等疾病人群中的遗传变异,这些变异在无病人群中较少见。因此,GWAS 数据可用于识别与疾病相关的遗传变异。特征选择和机器学习方法可用于分析 GWAS 数据并识别潜在的疾病生物标志物。然而,GWAS 研究存在技术差异,影响所识别生物标志物的可重复性,例如基因分型平台和待分型个体筛选标准的不同。为解决此问题,我们从基因型和表型数据库(dbGaP)收集了五个 GWAS 数据集,并探索了若干数据整合策略。我们根据不同策略在被视为潜在 PD 生物标志物的单核苷酸多态性(SNPs)方面评估了一致性。我们的结果显示,使用不同数据集或整合策略发现的生物标志物一致性较低。然而,我们识别出五十个被至少两次发现的 SNPs,它们有可能作为新型 PD 生物标志物。这些 SNPs 在文献中与 PD 间接相关,但此前从未被直接与 PD 关联。这些发现开辟了新的潜在研究途径。
引用
@article{arxiv.2304.03239,
title = {Assessing the Reproducibility of Machine-learning-based Biomarker Discovery in Parkinson's Disease},
author = {Ali Amelia and Lourdes Pena-Castillo and Hamid Usefi},
journal= {arXiv preprint arXiv:2304.03239},
year = {2023}
}
备注
20 pages, 4 figures