Prot42:用于靶标感知蛋白质结合子生成的新型蛋白质语言模型家族
生物大分子
2025-05-20 v2 人工智能
计算与语言
机器学习
摘要
解锁下一代生物技术和治疗创新需要克服传统蛋白质工程方法固有的复杂性和资源密集性。最近的生成式AI驱动的计算技术通常依赖于目标蛋白质三维结构和特定结合位点的可用性来生成高亲和力结合子,这是AlphaProteo和RFdiffusion等模型所表现出的约束。在这项工作中,我们探索了使用蛋白质语言模型(pLM)进行高亲和力结合子生成。我们介绍了Prot42,一种新型蛋白质语言模型(pLM)家族,在大量未标记蛋白质序列上进行了预训练。通过受自然语言处理突破启发的先进自回归、仅解码器架构捕捉深层的进化、结构和功能见解,Prot42极大地扩展了基于语言的计算机蛋白质设计的能力。值得注意的是,我们的模型处理长达8,192个氨基酸的序列,显著超越了标准限制,并能够精确建模大型蛋白质和复杂多域序列。展示了强大的实际应用,Prot42在生成高亲和力蛋白质结合子和序列特异性DNA结合蛋白方面表现出色。我们的创新模型已公开提供,为科学界提供了一种高效精确的计算机蛋白质工程工具包。
引用
@article{arxiv.2504.04453,
title = {Prot42: a Novel Family of Protein Language Models for Target-aware Protein Binder Generation},
author = {Mohammad Amaan Sayeed and Engin Tekin and Maryam Nadeem and Nancy A. ElNaker and Aahan Singh and Natalia Vassilieva and Boulbaba Ben Amor},
journal= {arXiv preprint arXiv:2504.04453},
year = {2025}
}