中文

大规模多组学生物序列变换器用于蛋白质-核酸相互作用建模

机器学习 2026-01-21 v6 生物大分子

摘要

变换器架构已彻底革新了生物信息学并推动了对生物分子属性的理解与预测。到目前为止,大多数生物序列变换器训练于单组学数据——要么是蛋白质,要么是核酸——并在各自领域的下游任务中取得了惊人的成功,尤其是在蛋白质结构建模方面取得了突破性进展。然而,单组学预训练限制了这些模型捕获跨模态相互作用的能力。本文提出 OmniBioTE,规模最大的开源多组学模型,训练于超过 2500 亿个标记的混合蛋白质与核酸数据。我们展示,尽管仅在无标签序列数据上训练,OmniBioTE 学习到了将基因映射到其相应蛋白质序列的联合表示。我们进一步证明,OmniBioTE 在预测给定核酸与蛋白质间结合自由能 ({\Delta G}) 的变化方面实现了最先进的成果。令人惊讶的是,我们展示了多组学生物序列变换器在无需任何先验结构训练的情况下即可学习有用的结构信息,从而预测哪些蛋白质残基最可能参与蛋白质-核酸结合相互作用。与在相同计算资源下训练的单组学控制模型相比,OmniBioTE 在多组学和单组学基准测试中显示出更高的性能/ FLOP 比率。总体而言,这些结果凸显了统一建模生物序列方法的力量,并将 OmniBioTE 确立为多组学发现的基础模型。

关键词

引用

@article{arxiv.2408.16245,
  title  = {Large-Scale Multi-omic Biosequence Transformers for Modeling Protein-Nucleic Acid Interactions},
  author = {Sully F. Chen and Robert J. Steele and Glen M. Hocky and Beakal Lemeneh and Shivanand P. Lad and Eric K. Oermann},
  journal= {arXiv preprint arXiv:2408.16245},
  year   = {2026}
}

备注

47 pages, 5 figures