中文

pUniFind:一个统一的大规模预训练深度学习模型推动质谱解释的极限

机器学习 2025-07-02 v1 人工智能

摘要

深度学习已推动质谱数据解释,但大多数模型仍是特征提取器而非统一的评分框架。我们提出pUniFind,这是首个在蛋白质组学中规模化的多模态预训练模型,集成了从头到尾的肽-光谱评分与开放、零样本 de novo 序列。该模型在超过1亿个开放搜索衍生的质谱上进行训练,通过跨模态预测对齐谱和肽模态,性能优于传统引擎,尤其在免疫肽组学中实现了识别肽数量提高42.6%。支持超过1300种修饰,pUniFind的PSM识别数量比现有 de novo 方法高出60%,尽管搜索空间扩大了300倍。基于深度学习的质量控制模块进一步恢复了38.5%的额外肽,包括1891个映射到基因组但不存在于参考蛋白质组中的肽,同时保持完整的片段离子覆盖。这些结果建立了一个统一、可扩展的深度学习框架,用于蛋白质组分析,提供更高的灵敏度、修饰覆盖范围和可解释性。

关键词

引用

@article{arxiv.2507.00087,
  title  = {pUniFind: a unified large pre-trained deep learning model pushing the limit of mass spectra interpretation},
  author = {Jiale Zhao and Pengzhi Mao and Kaifei Wang and Yiming Li and Yaping Peng and Ranfei Chen and Shuqi Lu and Xiaohong Ji and Jiaxiang Ding and Xin Zhang and Yucheng Liao and Weinan E and Weijie Zhang and Han Wen and Hao Chi},
  journal= {arXiv preprint arXiv:2507.00087},
  year   = {2025}
}