中文

基于 Transformer 的数据非依赖性采集质谱从头肽段测序

定量方法 2024-06-27 v3 人工智能

摘要

串联质谱(MS/MS)是全面分析生物样品中蛋白质含量的主要高通量技术。该方法是推动蛋白质组学发展的基石。近年来,数据非依赖性采集(DIA)策略取得了重大进展,促进了前体离子的公正和非靶向碎裂。DIA 生成的 MS/MS 谱图由于其固有的高多重性而构成了巨大的挑战。每个谱图都包含了源自多个前体肽段的碎裂产物离子。这种复杂性对从头肽段/蛋白质测序构成了尤为严峻的挑战,而现有方法难以解决这一多重性难题。在本文中,我们介绍了 DiaTrans,一种基于 Transformer 架构的深度学习模型,用于从 DIA 质谱数据中解读肽段序列。我们的结果显示,与现有的 SOTA 方法(包括 DeepNovo-DIA 和 PepNet)相比有显著改进。Casanovo-DIA 在氨基酸水平上将精确度提高了 15.14% 至 34.8%,召回率提高了 11.62% 至 31.94%,并在肽段水平上将精确度提高了 59% 至 81.36%。整合 DIA 数据和我们的 DiaTrans 模型在发现新肽段和更全面地剖析生物样品方面具有相当大的前景。Casanovo-DIA 根据 GNU GPL 许可证免费提供,网址为 https://github.com/Biocomputing-Research-Group/DiaTrans。

关键词

引用

@article{arxiv.2402.11363,
  title  = {Transformer-based de novo peptide sequencing for data-independent acquisition mass spectrometry},
  author = {Shiva Ebrahimi and Xuan Guo},
  journal= {arXiv preprint arXiv:2402.11363},
  year   = {2024}
}

备注

Ebrahimi S., Guo X. Transformer-based de novo peptide sequencing for data-independent acquisition mass spectrometry. In 2023 IEEE 23rd International Conference on Bioinformatics and Bioengineering (BIBE) 2022 Dec 6 (pp. 17-22). IEEE