一个蛋白质就够了
机器学习
2026-03-03 v3 生物大分子
摘要
在生物学的机器学习中,超越训练数据的泛化仍然是一个核心挑战。增强泛化的常见方法是在大型数据集上进行自监督预训练。然而,旨在对所有可能的蛋白质表现良好可能会限制模型在特定蛋白质上的卓越能力,而实验人员通常需要对其研究的个别蛋白质进行准确预测,而这些蛋白质往往不在训练数据中。为了解决这一局限,我们提出了一种方法,使蛋白质语言模型能够进行自监督定制,一次针对一个目标蛋白质,实时进行,且无需任何额外数据。我们证明,我们的蛋白质测试时训练(ProteinTTT)方法在不同模型、模型规模和数据集上始终增强泛化能力。ProteinTTT 改善了具有挑战性目标的结构预测,在蛋白质适应度预测上取得了新的最先进结果,并在两项任务上增强了功能预测。通过两个具有挑战性的案例研究,我们还表明通过 ProteinTTT 进行定制可以实现更准确的抗体-抗原环建模,并增强了大型奇妙病毒数据库中 19% 的结构,在这些结构中通用型 AlphaFold2 和 ESMFold 难以给出准确的预测。
引用
@article{arxiv.2411.02109,
title = {One protein is all you need},
author = {Anton Bushuiev and Roman Bushuiev and Olga Pimenova and Nikola Zadorozhny and Raman Samusevich and Elisabet Manaskova and Rachel Seongeun Kim and Hannes Stärk and Jiri Sedlar and Martin Steinegger and Tomáš Pluskal and Josef Sivic},
journal= {arXiv preprint arXiv:2411.02109},
year = {2026}
}