HelixFold-Single:以蛋白质语言模型作为替代的无 MSA 蛋白质结构预测
生物大分子
2023-10-19 v3 人工智能
机器学习
定量方法
摘要
基于 AI 的蛋白质结构预测流程,如 AlphaFold2,已达到接近实验的精度。这些先进流程主要依赖多序列比对(MSAs)作为输入,从同源序列中学习共进化信息。然而,从蛋白质数据库中搜索 MSA 非常耗时,通常花费数十分钟。因此,我们试图仅利用蛋白质的一级序列探索快速蛋白质结构预测的极限。HelixFold-Single 被提出将大规模蛋白质语言模型与 AlphaFold2 优越的几何学习能力相结合。我们提出的方法 HelixFold-Single 首先利用自监督学习范式,以数亿条一级序列预训练大规模蛋白质语言模型(PLM),该模型将作为 MSA 的替代用于学习共进化信息。然后,通过结合预训练的 PLM 与 AlphaFold2 的核心组件,我们获得一个端到端可微模型,仅从一级序列预测原子的 3D 坐标。HelixFold-Single 在 CASP14 与 CAMEO 数据集上得到验证,在具有大型同源家族的目标上取得了与基于 MSA 的方法相竞争的精度。此外,HelixFold-Single 比主流蛋白质结构预测流程消耗少得多的时问,展示了其在需要大量预测的任务中的潜力。HelixFold-Single 的代码可在 https://github.com/PaddlePaddle/PaddleHelix/tree/dev/apps/protein_folding/helixfold-single 获取,我们也在 https://paddlehelix.baidu.com/app/drug/protein-single/forecast 提供了稳定的网络服务。
引用
@article{arxiv.2207.13921,
title = {HelixFold-Single: MSA-free Protein Structure Prediction by Using Protein Language Model as an Alternative},
author = {Xiaomin Fang and Fan Wang and Lihang Liu and Jingzhou He and Dayong Lin and Yingfei Xiang and Xiaonan Zhang and Hua Wu and Hui Li and Le Song},
journal= {arXiv preprint arXiv:2207.13921},
year = {2023}
}