中文

探究蛋白质语言模型中表征的形态

机器学习 2026-05-29 v2

摘要

虽然蛋白质语言模型(PLM)是未来从头蛋白质设计最具前景的研究方向之一,但它们如何将序列转换为隐藏表征,以及这些表征中编码了何种信息,仍有待完全理解。已有若干工作尝试为 PLM 提出可解释性工具,但它们侧重于理解单个序列如何被此类模型转换。因此,PLM 如何转换整个序列空间及其相互关系仍然未知。在本工作中,我们试图通过将蛋白质结构与表征等同于平方根速度(SRV)表征和图过滤来理解这种转换后的序列空间。这两种方法自然地导出了一个度量空间,在该空间中可以将成对的蛋白质或蛋白质表征进行相互比较。我们分析了 SCOP 数据集中的不同类型蛋白质,并表明 SRV 形状空间的 Karcher 均值和有效维度在不同大小的 ESM2 模型中作为层的函数呈现非线性模式。此外,我们使用图过滤作为工具来研究模型编码蛋白质结构特征的上下文长度。我们发现,PLM 优先编码残基之间的直接和局部关系,但在更大的上下文长度下开始退化。最忠实于结构的编码往往出现在接近但位于模型最后一层之前的位置,这表明在这些层之上训练折叠模型可能会带来更好的折叠性能。

关键词

引用

@article{arxiv.2509.24895,
  title  = {Towards Understanding the Shape of Representations in Protein Language Models},
  author = {Kosio Beshkov and Anders Malthe-Sørenssen},
  journal= {arXiv preprint arXiv:2509.24895},
  year   = {2026}
}

备注

Accepted as a poster at ICLR 2026. OpenReview: https://openreview.net/forum?id=Dnn8SSBJaY