解释人工神经网络以检测复杂特征的基因组关联信号
基因组学
2025-02-12 v2 机器学习
定量方法
摘要
调查复杂疾病的基因组结构具有挑战性,因为基因组和环境影响的相互作用landscape 具有多因素和交互性。尽管基因组关联研究 (GWAS) 已识别了多个复杂特征的成千上万的变异,但常规统计方法受限于线性和缺乏 epistasis 的模型假设。本工作我们训练人工神经网络以预测复杂特征,运用于模拟和真实的基因型-表型数据集。我们通过不同的事后可解释性方法提取特征重要性得分,以识别目标表型的潜在关联 loci (PAL),并构建获取检测 PAL 的 p 值的方案。多种参数的模拟结果表明,严格的选择标准下可良好精确地检测关联 loci。通过将方法应用于爱沙群体生物库中的精神分裂队列,我们检测到了多个与该高度多基因和可遗传性疾病相关的 loci。PAL 与先前与精神分裂和双相情感障碍相关的 loci 之间存在显著的 concordance,富集分析的基因主要指向与脑形态和功能相关的术语。随着模型优化和不确定性量化的进步,人工神经网络有潜力提高识别与复杂疾病相关的基因组 loci 的能力,为 GWAS 提供更全面的方法,作为后续功能研究的初始筛选工具。
引用
@article{arxiv.2407.18811,
title = {Interpreting artificial neural networks to detect genome-wide association signals for complex traits},
author = {Burak Yelmen and Maris Alver and Merve Nur Güler and Estonian Biobank Research Team and Flora Jay and Lili Milani},
journal= {arXiv preprint arXiv:2407.18811},
year = {2025}
}
备注
18 pages, 3 main figures, 1 main table. Extensive changes from the previous version including new methodology for obtaining statistical significance and extended discussion