生物学信息神经网络从组学数据学习非线性表征以提升基因组预测与可解释性
机器学习
2025-10-17 v1
摘要
我们将生物学信息神经网络(BINNs)扩展用于作物的基因组预测(GP)与选择(GS),通过将数千个单核苷酸多态性(SNPs)与多组学测量数据以及先验生物学知识相结合。传统的基因型到表型(G2P)模型高度依赖直接映射,仅实现有限的准确性,迫使选育者进行大规模、高成本的田间试验以维持或略微提高遗传增益。采用包含基因表达等中间分子表型的模型可实现更高的预测拟合,但由于在部署或设计时缺乏此类数据,故实际用于 GS 仍不可行。BINNs 通过编码通路水平的归纳偏置,在训练时利用多组学数据,而在推理时仅使用基因型数据。应用于玉米基因表达和多环境田间试验数据时,BINN 在稀疏数据条件下可使等位基因秩相关准确率提高最高可达 56%,并在非线性地识别出 GWAS/TWAS 未能发现的基因。对于合成代谢组基准测试,若采用完整领域知识,BINN 可将预测误差相对于常规神经网络降低 75%,并正确识别最重要的非线性通路。重要的是,两种情况下,BINN 的高灵敏度潜变量均与其所代表的实验量相关,尽管其未在训练中使用。这表明 BINNs 从基因型到表型学习到生物学相关的表征,无论是非线性还是线性。BINNs 建立了一种框架,利用中间领域信息以提高基因组预测准确性,并揭示可指导基因组选择、候选基因选择、通路富集和基因编辑优先级的非线性生物学关系。
引用
@article{arxiv.2510.14970,
title = {Biology-informed neural networks learn nonlinear representations from omics data to improve genomic prediction and interpretability},
author = {Katiana Kontolati and Rini Jasmine Gladstone and Ian Davis and Ethan Pickering},
journal= {arXiv preprint arXiv:2510.14970},
year = {2025}
}
备注
35 pages, 12 figures