一种整合基因组规模代谢建模与机器学习框架用于预测和优化酿酒酵母单细胞蛋白生产
机器学习
2026-05-12 v2
摘要
酿酒酵母(Saccharomyces cerevisiae)正日益被视为单细胞蛋白(SCP)生产的关键来源,这是应对全球蛋白质供应挑战的新兴解决方案。本研究提出了一种计算框架,将Yeast9基因组规模代谢模型(GEM)与机器学习和优化相结合,用于预测和提升SCP产量的生物量通量。Yeast9 GEM包含4,131个反应、2,806种代谢物和1,161个基因,通过通量平衡分析(FBA)在2,000个拉丁超立方采样通量轮廓上进行模拟。随机森林和XGBoost回归器分别实现了R²值为0.9999760和0.9997702。变分自编码器(VAE)识别出四个代谢簇,平均生物量通量分别为0.472、0.493、0.527和0.505 gDW/hr。基于SHAP的特征归因识别出糖酵解、三羧酸循环和氨基酸生物合成中的20个关键反应;其中18/20(90%)经计算机模拟敲除验证为必需反应。贝叶斯优化在葡萄糖=-20.0、氧气=-20.0、铵=-8.9 mmol/gDW/hr条件下实现了生物量通量12.13倍的提升(从0.0858到1.041 gDW/hr)。生成对抗网络(GAN)生成了新的通量配置(方差=0.124);化学计量可行性验证返回0/100个可行轮廓,原因在于生成器收敛不完全,这被报告为局限性。帕累托前沿分析识别出一个最优SCP工作点:生物量通量0.0858 gDW/hr,氨基酸生物合成得分为1000.029 mmol/gDW/hr。
引用
@article{arxiv.2603.25561,
title = {An Integrative Genome-Scale Metabolic Modeling and Machine Learning Framework for Predicting and Optimizing Single-Cell Protein Production in Saccharomyces cerevisiae},
author = {Neha K. Nair and Aaron D'Souza},
journal= {arXiv preprint arXiv:2603.25561},
year = {2026}
}
备注
22 pages, 7 figures, and 4 tables