中文

用于解码 mRNA 非翻译区与功能预测的 5' UTR 语言模型

机器学习 2023-10-09 v2 人工智能

摘要

5' UTR 是 mRNA 分子起始处的调控区域,在调节翻译过程中起关键作用,并影响蛋白质表达水平。语言模型已在解码蛋白质和基因组序列功能方面展现出有效性。在此,我们引入了用于 5' UTR 的语言模型,称之为 UTR-LM。UTR-LM 在来自多个物种的内源 5' UTR 上进行预训练,并进一步用包括二级结构和最小自由能的监督信息增强。我们在多种下游任务上对 UTR-LM 进行微调。该模型在预测平均核糖体负载方面优于已知最佳基准达 42%,在预测翻译效率和 mRNA 表达水平方面优于达 60%。该模型也适用于识别非翻译区内未注释的内部核糖体进入位点,并将 AUPR 从 0.37 提升至 0.52(相比最佳基线)。进一步,我们设计了一个包含 211 个具有高预测翻译效率值的新型 5' UTR 的文库,并通过湿实验测定进行评估。实验结果证实,我们的最优设计相对于已确立的用于治疗优化的 5' UTR 实现了蛋白质产量水平 32.5% 的提升。

关键词

引用

@article{arxiv.2310.03281,
  title  = {A 5' UTR Language Model for Decoding Untranslated Regions of mRNA and Function Predictions},
  author = {Yanyi Chu and Dan Yu and Yupeng Li and Kaixuan Huang and Yue Shen and Le Cong and Jason Zhang and Mengdi Wang},
  journal= {arXiv preprint arXiv:2310.03281},
  year   = {2023}
}

备注

Sorry for withdrawing this manuscript. Because we want to major revised this manuscript, and it need some time