超过其组成部分:在蛋白质编码模型中构建次级结构
定量方法
2026-03-03 v2
摘要
蛋白质表征学习正在快速进展,主要是得益于序列和结构监督数据的规模化,但大多数模型要么将蛋白质编码为每个残基的标记序列,要么作为单个全局嵌入。这忽略了蛋白质组织的一个关键属性:蛋白质由反复、进化保守的次级结构构成,这些次级结构浓缩了生化活性并介导核心分子功能。虽然次级结构如域和功能位点被系统性地列出,但在蛋白质模型中很少用作训练信号或表示单元。我们引入了Magneton,一个用于开发次级结构感知蛋白质模型的环境。Magneton提供了(1)包含53万片蛋白质,标注超过170万个次级结构,覆盖13000多种类型的数据集;(2)将次级结构纳入现有蛋白质模型中的训练框架;(3)由13项任务构成的基准套件,探索残基、次级结构和蛋白质水平的表示。通过Magneton,我们开发了次级结构调谐(substructure-tuning)方法,将次级结构知识蒸馏到预训练蛋白质模型中。在一系列基于序列和结构的前沿模型中,次级结构调谐提高了功能预测,生成了更一致的次级结构类型表示,这些类型在调谐期间从未被观察到,并且表明次级结构监督提供的信息与全局结构输入是互补的。Magneton环境、数据集和次级结构调谐模型全部公开可用(https://github.com/rcalef/magneton/)。
引用
@article{arxiv.2512.18114,
title = {Greater than the Sum of Its Parts: Building Substructure into Protein Encoding Models},
author = {Robert Calef and Arthur Liang and Manolis Kellis and Marinka Zitnik},
journal= {arXiv preprint arXiv:2512.18114},
year = {2026}
}