基于加速线性代数技术训练来自功能注释的基因变体效应的灵活模型
机器学习
2025-07-01 v2 种群与进化
摘要
为了理解人类基因组中基因变体如何在表型上显现——诸如身高或像哮喘这样的疾病——基因学家对数百万人进行基因测序和测量。基因学家利用这些数据构建模型来预测给定变体的基因特征(如 DNA 可及性或附近 DNA 结合蛋白的存在)时,基因变体对表型的影响。在更多数据和特征可用后,一个人可能会期待预测模型会得到改进。不幸的是,训练这些模型受限于需要解决昂贵线性代数问题的瓶颈,因为基因组中的变体与附近变体相关,需要对大型矩阵进行反演。以前的方法因此受限于拟合小型模型,或拟合简化的概括统计量,而非统计模型的完整似然函数。在本文中,我们利用现代快速线性代数技术开发了 DeepWAS (Deep genome Wide Association Studies),一种方法来训练大型灵活神经网络预测模型以优化似然函数。值得注意的是,我们发现只有在使用完整似然方法时,较大的模型才会在性能上有所提升;当通过拟合传统概括统计量训练时,较大的模型与小型模型性能相当。我们发现,更多特征上训练的大型模型会做出更好的预测,potentially 改善疾病预测和治疗靶点的识别。
关键词
引用
@article{arxiv.2506.19598,
title = {Training Flexible Models of Genetic Variant Effects from Functional Annotations using Accelerated Linear Algebra},
author = {Alan N. Amin and Andres Potapczynski and Andrew Gordon Wilson},
journal= {arXiv preprint arXiv:2506.19598},
year = {2025}
}
备注
For example: ICML 2025. Code available at: https://github.com/AlanNawzadAmin/DeepWAS