中文

基于动态蛋白质词表的蛋白质设计

机器学习 2025-10-15 v2 人工智能 生物大分子

摘要

蛋白质设计是生物技术中的一项基础挑战,旨在从海量可能的蛋白质空间中设计出具有特定功能的新序列。深度生成模型的最新进展使得基于文本描述的功能性蛋白质设计成为可能,但在结构合理性方面仍存在困难。受利用天然蛋白质结构的经典蛋白质设计方法启发,我们探索了在生成模型中引入天然蛋白质片段是否能增强可折叠性。我们的实证结果表明,即使是随机引入片段也能改善可折叠性。基于这一洞察,我们引入了 ProDVa,这是一种新颖的蛋白质设计方法,它集成了用于功能描述的文本编码器、用于设计蛋白质的蛋白质语言模型,以及根据文本功能描述动态检索蛋白质片段的片段编码器。实验结果表明,我们的方法能有效地设计出在功能上对齐且在结构上合理的蛋白质序列。与现有模型相比,ProDVa 使用不到 0.04% 的训练数据即实现了相当的功能对齐,同时设计了显著更多的折叠良好的蛋白质,其中 pLDDT 高于 70 的蛋白质比例增加了 7.38%,PAE 低于 10 的比例增加了 9.6%。

关键词

引用

@article{arxiv.2505.18966,
  title  = {Protein Design with Dynamic Protein Vocabulary},
  author = {Nuowei Liu and Jiahao Kuang and Yanting Liu and Tao Ji and Changzhi Sun and Man Lan and Yuanbin Wu},
  journal= {arXiv preprint arXiv:2505.18966},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025 (Spotlight)