基于预训练蛋白质大语言模型的肉毒性预测深度学习模型
机器学习
2025-08-19 v1 人工智能
定量方法
摘要
肽和蛋白质肉毒性预测仍是生物信息学中的焦点。该领域的关键步骤是应用先进的计算方法。许多最近的预测方法高度依赖进化图案和氨基酸的单个属性。越来越明显的是,基于序列信息的特征显示出高预测性能。因此,我们的研究评估了从预训练蛋白质大语言模型中获取的上下文特征,利用双向LSTM和GRU来预测肽和蛋白质序列中的肉毒性区域。我们的方法在10折交叉验证上的准确率为84.5%,在测试数据集上的准确率为83%。我们的结果表明性能具有竞争力,突显了大语言模型在提高肉毒预测准确率中的潜力。
引用
@article{arxiv.2508.12575,
title = {Deep Learning Model for Amyloidogenicity Prediction using a Pre-trained Protein LLM},
author = {Zohra Yagoub and Hafida Bouziane},
journal= {arXiv preprint arXiv:2508.12575},
year = {2025}
}