用于改进从头肽测序的通用生物序列重排
机器学习
2025-06-02 v2 人工智能
摘要
从头肽测序是蛋白质组学中的关键任务。然而,当前基于深度学习的方法的性能受限于质谱数据的固有复杂性和噪声信号的异质分布,导致数据特定的偏差。我们提出了RankNovo,这是首个通过利用多个测序模型的互补优势来增强从头肽测序的深度重排框架。RankNovo采用列表式重排方法,将候选肽建模为多序列比对,并利用轴向注意力在候选者之间提取信息特征。此外,我们引入了两个新指标:PMD(肽质量偏差)和RMD(残基质量偏差),通过在序列和残基层面量化肽之间的质量差异来提供精细的监督。大量实验表明,RankNovo不仅超越了用于生成重排预训练训练候选者的基础模型,还设立了新的最先进基准。此外,RankNovo展现出对未见过的模型的强零样本泛化能力,这些模型的生成结果在训练期间未暴露在外,突显了其鲁棒性以及作为肽测序通用重排框架的潜力。我们的工作提出了一种新的重排策略,从根本上挑战了现有的单模型范式,推动了精确从头测序的前沿。我们的源代码在GitHub上提供。
引用
@article{arxiv.2505.17552,
title = {Universal Biological Sequence Reranking for Improved De Novo Peptide Sequencing},
author = {Zijie Qiu and Jiaqi Wei and Xiang Zhang and Sheng Xu and Kai Zou and Zhi Jin and Zhiqiang Gao and Nanqing Dong and Siqi Sun},
journal= {arXiv preprint arXiv:2505.17552},
year = {2025}
}