由大语言模型定义的折叠蛋白序列空间结构
生物大分子
2023-11-13 v1 种群与进化
摘要
蛋白质在高维序列空间中分布于一个流形之上,其几何结构引导着它们的自然演化。利用近期开发的基于transformer模型的structure预测工具,我们首先考察由折叠打分函数所定义的蛋白序列景观。该景观与机器学习及约束满足问题中遇到的优化难题具有共性。我们的分析揭示,天然蛋白主要栖身于此能量景观中宽阔平坦的极小值处。为进一步探究,我们采用专为探索相对平坦景观中高局部熵区域而设计的统计力学算法。结果表明,相较于蒙特卡洛马尔可夫链等传统方法,这些专用算法能识别出熵更高的谷。在一个概念验证案例中,我们发现这些高熵极小值尤其在关键位点和局部熵上与天然序列表现出显著相似性。此外,分子动力学评估表明这些序列的稳定性与天然蛋白极为接近。我们的工具结合了机器学习与统计物理学的进展,为探索宽阔平坦极小值与多数较窄极小值并存的序列景观提供了新见解。
引用
@article{arxiv.2311.06034,
title = {Structure of the space of folding protein sequences defined by large language models},
author = {A. Zambon and R. Zecchina and G. Tiana},
journal= {arXiv preprint arXiv:2311.06034},
year = {2023}
}