基于条件互信息的自适应De Novo肽段排序
定量方法
2024-03-18 v2 机器学习
生物大分子
摘要
串联质谱(tandem mass spectrometry)在推动蛋白质组学研究方面发挥了关键作用,使能够分析生物样本中的蛋白质组成。尽管已 developed 各种深度学习方法用于识别由观察到的谱图负责的氨基酸序列(肽段),但在de novo肽段排序中仍存在挑战。首先,先前方法难以识别带有后翻译修饰(PTMs)的氨基酸,因为这些氨基酸在训练数据中的出现频率远低于标准氨基酸,进而导致肽段水平识别精度下降。其次,质谱图中的各种噪声和缺失峰会降低训练数据(肽段-谱图匹配,PSMs)的可靠性。为此,本文提出了Adanovo框架,通过计算谱图与每个氨基酸/肽段之间的条件互信息(CMI),利用CMI进行自适应模型训练。广泛的实验表明,Adanovo在9个物种基准测试中实现了最先进的性能,其中训练集中的肽段几乎与测试集中的肽段完全不重叠。此外,Adanovo在识别带PTMs的氨基酸方面表现出色,并对数据噪声具有良好的鲁棒性。附录材料包含官方代码。
关键词
引用
@article{arxiv.2403.07013,
title = {AdaNovo: Adaptive \emph{De Novo} Peptide Sequencing with Conditional Mutual Information},
author = {Jun Xia and Shaorong Chen and Jingbo Zhou and Tianze Ling and Wenjie Du and Sizhe Liu and Stan Z. Li},
journal= {arXiv preprint arXiv:2403.07013},
year = {2024}
}