大规模蛋白质折叠分类:基准测试与预训练
机器学习
2026-05-19 v1 生物大分子
定量方法
摘要
蛋白质拓扑结构分类对于破译生物学功能至关重要,但由于缺乏避免重复的大规模基准测试以及模型难以有效扩展,该领域的进展受到阻碍。我们引入了 TEDBench,这是一个基于结构域百科全书(TED)和 Foldseek 聚类的 AlphaFold 结构构建的、用于蛋白质折叠分类的大规模非冗余基准测试。我们表明,在 TEDBench 上,当前的蛋白质表示学习方法要么需要非常大的模型,要么无法提供强大的性能。为了应对这一挑战,我们提出了掩码不变自编码器,这是一个用于蛋白质结构表示学习的自监督框架。MiAE 使用高达 90% 的极高掩码率,结合一个 不变编码器和一个轻量级解码器,该解码器从潜在表示和掩码令牌重建骨架坐标。MiAE 具有良好的可扩展性,在 TEDBench 上优于监督对应方法和最先进的基线,为蛋白质折叠分类确立了强有力的方案。为了测试在 AlphaFold 结构之外的迁移能力,我们进一步在基于 CATH v4.4 实验结构的精选数据集上进行了基准测试。TEDBench 可在 https://github.com/BorgwardtLab/TEDBench 获取。
引用
@article{arxiv.2605.18552,
title = {Protein Fold Classification at Scale: Benchmarking and Pretraining},
author = {Dexiong Chen and Andrei Manolache and Mathias Niepert and Karsten Borgwardt},
journal= {arXiv preprint arXiv:2605.18552},
year = {2026}
}
备注
Accepted at ICML 2026 (spotlight)