中文

蛋白质适应性预测的多尺度表征学习

组合数学 2024-12-03 v1 环与代数

摘要

设计新型功能蛋白质关键取决于准确建模其适应性景观。鉴于从实验室实验中获得的功能注释稀缺,先前方法主要依赖于在广泛的无标记蛋白质序列或结构数据集上训练的自监督模型。虽然最初的蛋白质表征学习研究仅聚焦于序列或结构特征,但近期的混合架构试图合并这两种模态以发挥其各自优势。然而,这些序列-结构模型与领先的仅基于序列的方法相比仅实现了量化改进,凸显了有效利用这些模态的未解决挑战。此外,某些蛋白质的功能高度依赖其表面拓扑的细粒度方面,这些方面被先前模型所忽略。为解决这些限制,我们提出Sequence-Structure-Surface Fitness(S3F)模型——一种新的多模态表征学习框架,用于跨多个尺度整合蛋白质特征。我们的方案将来自蛋白质语言模型的序列表征与几何向量感知器网络相结合,后者编码蛋白质主链和详细表面拓扑。所提方法在涵盖217个取代深入突变扫描实验的ProteinGym基准测试上实现了最先进的适应性预测,并提供了关于蛋白质功能决定因素的见解。我们的代码位于 https://github.com/DeepGraphLearning/S3F。

关键词

引用

@article{arxiv.2412.01107,
  title  = {Clonoids of Boolean functions with essentially unary, linear, semilattice, or 0- or 1-separating source and target clones},
  author = {Erkko Lehtonen},
  journal= {arXiv preprint arXiv:2412.01107},
  year   = {2024}
}

备注

27 pages