整合深度学习与合成生物学:通过N端编码序列增强基因表达的协同设计方法
定量方法
2024-02-22 v1 人工智能
摘要
N端编码序列(NCS)通过影响翻译起始速率来调控基因表达。NCS优化问题旨在寻找最大化基因表达的NCS。该问题在基因工程中至关重要。然而,当前的NCS优化方法(如理性设计和统计引导方法)劳动强度大,且仅能带来相对较小的改进。本文介绍了一种深度学习/合成生物学协同设计的少样本训练工作流用于NCS优化。我们的方法利用k近邻编码后接word2vec对NCS进行编码,然后使用注意力机制进行特征提取,再构建时间序列网络预测基因表达强度,最后通过直接搜索算法在有限的训练数据下识别最优NCS。我们以枯草芽孢杆菌表达的绿色荧光蛋白(GFP)作为NCS的报告蛋白,并采用荧光增强因子作为NCS优化的指标。仅经过六次迭代实验,我们的模型生成了一个NCS(MLD62),使平均GFP表达提高了5.41倍,超越了最先进的NCS设计。将我们的发现扩展到GFP之外,我们展示了工程化的NCS(MLD62)能够通过增强关键限速基因GNA1的表达来有效提高N-乙酰神经氨酸的产量,证明了其实用价值。我们已开源了NCS表达数据库和实验步骤供公众使用。
引用
@article{arxiv.2402.13297,
title = {Integrating Deep Learning and Synthetic Biology: A Co-Design Approach for Enhancing Gene Expression via N-terminal Coding Sequences},
author = {Zhanglu Yan and Weiran Chu and Yuhua Sheng and Kaiwen Tang and Shida Wang and Yanfeng Liu and Weng-Fai Wong},
journal= {arXiv preprint arXiv:2402.13297},
year = {2024}
}