Peptide-GPT:基于生成式预训练变换器的肽生成设计
机器学习
2024-10-28 v1 定量方法
摘要
近年来,天然语言处理(NLP)模型在传统文本生成之外展现出惊人的能力。本文介绍了 PeptideGPT,这是一款针对具有不同特性的蛋白质序列(如溶血活性、溶解性和非污染特性)进行生成的蛋白质语言模型。为评估这些生成序列, 我们建立了一套来自生信学的全面评估管道,以保留具有有序结构的有效蛋白质。首先,我们根据 perplexity 分数对生成序列进行排序,然后筛选掉位于蛋白质可允许凸包边界之外的序列。最后,我们使用 ESMFold 预测结构并选取 pLDDT 值大于 70 的蛋白质,以确保有序结构。所生成序列的属性通过任务特定分类器(PeptideBERT 和 HAPPENN)进行评估。在溶血、非溶血和非污染蛋白质生成方面,我们分别实现了 76.26%、72.46% 和 78.84% 的准确率,而溶解性蛋白质生成的准确率为 68.06%。我们的实验结果表明,PeptideGPT 在 de novo 蛋白质设计中具有有效性,并凸显了利用 NLP 方法为合成生物学和生信学未来创新和突破提供途径的潜力。本研究中使用的代码、模型和数据均可在 https://github.com/aayush-shah14/PeptideGPT 获取。
引用
@article{arxiv.2410.19222,
title = {Peptide-GPT: Generative Design of Peptides using Generative Pre-trained Transformers and Bio-informatic Supervision},
author = {Aayush Shah and Chakradhar Guntuboina and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2410.19222},
year = {2024}
}