中文

蛋白构象集合字母表:ENSEMBITS

机器学习 2026-05-15 v2 人工智能 生物大分子

摘要

蛋白结构标记化器(PST)是蛋白语言建模、功能预测和演化分析中的核心工具。然而,现有 PST 仅捕捉静态结构的局部几何,无法捕获蛋白ensemble 中揭示的相关运动和备选构象状态。本文介绍 Ensembits——首个针对蛋白构象集合的标记化器。Ensembits 解决动态化标记化中的核心挑战:跨构象 deriving 有信息的几何描述、变大小 ensemble 的排列不变性编码,以及克服动态数据稀疏性。我们采用基于残差 VQ-VAE 的框架,并以帧蒸馏目标在大型分子动力学语料库上训练,Ensembits 在 RMSF 预测上超越所有相关方法,在基于 per-residue 运动幅度的基于标记的 ANOVA 测试中表现为最强的独立结构标记化器。尽管使用的数据量远少于静态标记化器,Ensembits 在 EC、GO、结合位点/亲和力预测以及零样突变效应预测中均可匹配或超越静态标记化器。值得注意的是,蒸馏目标使 Ensembits 能够从单个预测结构预测动态标记,从而缓解动态数据稀疏性。随着领域从静态结构预测迈向 ensemble 生成,Ensembits 提供了将动态信息引入蛋白语言建模与设计所需的离散词汇表。

关键词

引用

@article{arxiv.2605.13789,
  title  = {ENSEMBITS: an alphabet of protein conformational ensembles},
  author = {Kaiwen Shi and Carlos Oliver},
  journal= {arXiv preprint arXiv:2605.13789},
  year   = {2026}
}