中文

从词语到氨基酸:深度诅咒是否仍然存在?

机器学习 2026-04-27 v2

摘要

蛋白质语言模型(PLMs)已广泛用作通用模型,显示出在蛋白质工程和 de novo 设计中强大的性能。像大型语言模型(LLMs)一样,它们通常以自回归或遮盖式标记预测目标在大型序列语料库上进行训练,并通过增加模型深度进行规模化。最近对自回归 LLMs 的研究识别出深度诅咒:后续许多层对最终输出预测贡献甚微。这自然引出了一个问题:类似的深度效率问题是否也出现在 PLMs 中,而其中许多常用模型并非自回归,且一些模型是多模态的,接受蛋白质序列和结构作为输入。在本文中,我们对七大流行 PLM 家族进行深度分析,横跨模型规模,涵盖自回归、遮盖式和扩散目标,并使用统一的一套探针、扰动和下游评估测量手段量化层次贡献如何随深度演变。在所有模型中,我们观察到一致的深度依赖模式,延续了对 LLMs 的先行发现:任务相关计算的大部分集中在一 subset of layers 中,而其余层主要为最终预测提供增量性细化。这些趋势超越序列唯一设置,同样出现在多模态 PLMs 中。综上所述,我们的结果表明,深度效率不足是现代 PLMs 的常见特征,激励未来工作开发更高效的深度架构和训练方法。

关键词

引用

@article{arxiv.2602.21750,
  title  = {From Words to Amino Acids: Does the Curse of Depth Persist?},
  author = {Aleena Siji and Amir Mohammad Karimi Mamaghan and Ferdinand Kapl and Tobias Höppe and Emmanouil Angelis and Andrea Dittadi and Maurice Brenner and Michael Heinzinger and Karl Henrik Johansson and Kaitlin Maile and Johannes von Oswald and Stefan Bauer},
  journal= {arXiv preprint arXiv:2602.21750},
  year   = {2026}
}