中文

pLMFPPred:一种整合预训练蛋白质语言模型嵌入与不平衡学习的功能性肽精准预测新方法

定量方法 2023-09-27 v1 机器学习

摘要

功能性肽具有治疗多种疾病的潜力。其良好的疗效与低毒性使之成为理想的治疗剂。基于人工智能的计算策略有助于从蛋白质序列集合中快速识别新的功能性肽并发现其不同功能。利用基于蛋白质语言模型的嵌入(ESM-2),我们开发了名为pLMFPPred(基于蛋白质语言模型的功能性肽预测器)的工具,用于预测功能性肽并识别毒性肽。我们还引入了SMOTE-TOMEK数据合成采样与基于Shapley值的特征选择技术,以缓解数据不平衡问题并降低计算成本。在验证独立测试集上,pLMFPPred的准确率、ROC曲线下面积(AUC)与F1分数分别达到0.974、0.99与0.974。对比实验显示,pLMFPPred优于当前功能性肽预测方法。实验结果表明,所提方法(pLMFPPred)在准确率、ROC曲线下面积与F1分数上均优于现有方法。pLMFPPred在功能性肽预测中取得了良好性能,代表了一种预测功能性肽的新计算方法。

关键词

引用

@article{arxiv.2309.14404,
  title  = {pLMFPPred: a novel approach for accurate prediction of functional peptides integrating embedding from pre-trained protein language model and imbalanced learning},
  author = {Zebin Ma and Yonglin Zou and Xiaobin Huang and Wenjin Yan and Hao Xu and Jiexin Yang and Ying Zhang and Jinqi Huang},
  journal= {arXiv preprint arXiv:2309.14404},
  year   = {2023}
}

备注

20 pages, 5 figures,under review