中文

利用预训练与交互建模进行 UK Biobank 中特定祖源疾病预测

机器学习 2024-05-08 v2 定量方法 应用统计 统计计算

摘要

最近的全基因组关联研究(GWAS)揭示了复杂性状的遗传基础,但显示出非欧洲裔个体的代表性不足,突显了遗传研究中的一个关键空白。在此,我们评估是否可以利用多组学数据改善跨不同祖源的疾病预测。我们评估了 Group-LASSO INTERaction-NET(glinternet)和预训练 lasso 在疾病预测中的性能,重点关注 UK Biobank 中的不同祖源。模型在来自英国白人和其他祖源的数据上进行训练,并在超过 96,000 名个体的队列中针对 8 种疾病进行验证。在训练的 96 个模型中,我们报告了 16 个在 ROC-AUC 分数方面具有统计学显著增量预测性能(p 值 < 0.05)的模型,这些模型针对糖尿病、关节炎、胆结石、膀胱炎、哮喘和骨关节炎。对于优于基线的交互模型和预训练模型,PRS 得分是预测背后的主要驱动因素。我们的研究结果表明,交互项和预训练都可以提高预测准确性,但仅限于有限的疾病集,且准确性的提升较为温和。

关键词

引用

@article{arxiv.2404.17626,
  title  = {Using Pre-training and Interaction Modeling for ancestry-specific disease prediction in UK Biobank},
  author = {Thomas Le Menestrel and Erin Craig and Robert Tibshirani and Trevor Hastie and Manuel Rivas},
  journal= {arXiv preprint arXiv:2404.17626},
  year   = {2024}
}