PepSpecBench:肽串联质谱预测统一评估基准
机器学习
2026-05-05 v1 人工智能
摘要
串联质谱提供了用于在复杂生物样本中鉴定与量化蛋白质的高通量框架。在计算质谱学中,预测肽 MS/MS 谱图是关键任务,使下游应用如大规模肽鉴定与量化成为可能。虽然深度学习架构显著提高了预测精度,但三个评估挑战仍遮蔽该领域真正进展。首先,数据预处理不一致且模型输出空间不兼容,妨碍公平比较。其次, flawed 数据划分策略可允许隐藏序列泄漏并夸大报告的性能。第三,现有评估通常缺乏全面的跨物种基准测试以及对模型对关键实验条件鲁棒性的系统性评估。为此,我们提出 PepSpecBench,一个用于肽 MS/MS 谱图预测的统一基准。PepSpecBench 在互补公共数据集之间标准化数据预处理,强制执行严格的 backbone-disjoint 划分策略以消除序列泄漏,并在共享片段离子表示空间中评估多种架构。它进一步引入了全面的多物种评估套件和基于物理的元数据扰动探针,以评估模型鲁棒性及仪器感知能力。我们发现六大代表模型之间存在此前未被识别的性能差异和鲁棒性限制,为未来模型设计、评估及实际部署提供了可操作的见解。
引用
@article{arxiv.2605.01945,
title = {PepSpecBench: A Unified Evaluation Benchmark for Peptide Tandem Mass Spectrometry Prediction},
author = {Zhiwen Yang and Pan Liu and Yifan Li and Yunhua Zhong and Jun Xia},
journal= {arXiv preprint arXiv:2605.01945},
year = {2026}
}
备注
25 pages, 7 figures