逆蒸馏:一致扩展蛋白语言模型表示的框架
机器学习
2026-03-10 v1 生物大分子
摘要
与自然语言处理和计算机视觉中可预测的扩展规律不同,蛋白质语言模型(PLMs)的扩展效果不佳:在许多任务上,同一系列中的模型会出现性能停滞甚至下降,中等规模模型往往优于最大模型。我们引入逆蒸馏(Reverse Distillation),一个原则性的框架,将大型蛋白质语言模型的表示分解为由同一系列中较小模型引导的正交子空间。 resulting embeddings具有嵌套的梅西洞穴式结构:较大模型嵌入的前k个维度恰好等于较小模型的表示。这确保了较大的逆蒸馏模型始终优于较小的模型。一个激励直觉是,较小的模型受容量约束,倾向于编码广泛共享的蛋白质特征。逆蒸馏隔离这些共享特征,并正交地从较大模型中提取额外贡献,防止两种特征之间的相互干扰。在ProteinGym基准测试中,逆蒸馏的ESM-2变体在相同的嵌入维度下优于各自的基线模型,逆蒸馏150亿参数模型实现了最强的性能。我们的框架可推广到任何存在扩展挑战的模型族。代码和训练好的模型均可在 https://github.com/rohitsinghlab/plm_reverse_distillation 获取。
引用
@article{arxiv.2603.07710,
title = {Reverse Distillation: Consistently Scaling Protein Language Model Representations},
author = {Darius Catrina and Christian Bepler and Samuel Sledzieski and Rohit Singh},
journal= {arXiv preprint arXiv:2603.07710},
year = {2026}
}
备注
Proceedings of ICLR 2026