中文

肽功能识别通用语言模型

机器学习 2025-12-05 v6 人工智能

摘要

准确识别生物活性肽(BPs)和蛋白质后翻译修饰(PTMs)对于理解蛋白质功能和推动治疗发现至关重要。然而,大多数计算方法在不同肽功能的通用性方面仍受限。本文提出 PDeepPP,一个统一的深度学习框架,集成了预训练蛋白质语言模型和混合 Transformer-CNN 架构,实现对不同肽类别和 PTM 位点的稳健识别。我们构建了全面的基准数据集,并实现了应对数据不平衡的策略,使 PDeepPP 能够系统提取全局和局部序列特征。通过广泛的分析,包括降维和比较研究,PDeepPP 在 33 个生物学识别任务中实现了卓越的、可解释的肽表征,并在 25 个任务中取得最先进的性能。值得注意的是,PDeepPP 在抗菌肽(0.9726)和磷酸化位点(0.9984)识别中取得高准确率,在糖基化位点预测中实现 99.5% 的特异性,并在抗疟疾任务中显著降低了假阳性率。通过实现大规模、准确的肽分析,PDeepPP 支持了生物医学研究和新兴疾病治疗靶点的发现。所有代码、数据集和预训练模型均通过 GitHub(https://github.com/fondress/PDeepPP)和 Hugging Face(https://huggingface.co/fondress/PDeppPP)公开获取。

关键词

引用

@article{arxiv.2502.15610,
  title  = {A general language model for peptide function identification},
  author = {Jixiu Zhai and Zikun Wang and Chupei Tang and Haitian Zhong and Ziyang Xu and Yuhuan Liu and Shengrui Xu and Jingwan Wang and Dan Huang and Tianchi Lu},
  journal= {arXiv preprint arXiv:2502.15610},
  year   = {2025}
}

备注

15 pages, 5 figures, 3 tables, submitted to arXiv