中文

归纳 meets 生物学:蛋白语言模型中重复检测的机制

机器学习 2026-05-26 v3 生物大分子

摘要

蛋白序列在重复片段中十分常见,这些片段既可以是精确复制,也可以是带有突变的近似片段。这些重复对于蛋白结构和功能至关重要,这激励了数十年来针对重复识别的算法工作。最近的研究表明,蛋白语言模型 (PLMs) 通过检查其在掩码标记预测中的行为来识别重复项。为阐明其内部机制,我们调查了 PLMs 如何检测精确重复项和近似重复项。我们发现,近似重复的检测机制在功能上包含了精确重复的检测机制。我们对该机制进行了特征化,揭示了两个主要阶段:首先,PLMs 利用通用位置注意力头和生物学专门组件(例如编码氨基酸相似性的神经元)构建特征表示。然后,归纳注意力头注意力地注意力跨越重复片段中对齐的标记,促进正确答案的生成。我们的结果揭示了 PLMs 如何通过结合基于语言的模式匹配与专门的生物学知识来解决这一生物学任务,从而为在 PLMs 中研究更复杂的进化过程奠定了基础。

关键词

引用

@article{arxiv.2602.23179,
  title  = {Induction Meets Biology: Mechanisms of Repeat Detection in Protein Language Models},
  author = {Gal Pomerants and Yaniv Nikankin and Anja Reusch and Tomer Tsaban and Ora Schueler-Furman and Yonatan Belinkov},
  journal= {arXiv preprint arXiv:2602.23179},
  year   = {2026}
}