中文

PUMA: 通过突变感知合并发现蛋白质单元

计算与语言 2025-12-15 v2 定量方法

摘要

蛋白质是生物过程的关键驱动力。从分子层面看,它们是由二十种标准残基构成的氨基酸链,可通过语言学视角加以理解,这些残基作为字母,组合形成被称为生命之语言的复杂语言。要理解这门语言,首先必须识别其基本单元。类似于单词,这些单元被假定为位于单个残基和更大域之间之间的中间层。关键的是,就蛋白质多样性而言,这些单元本应本质上反映进化关系。我们引入PUMA(Protein Units via Mutation-Aware Merging),用于发现这些具有进化意义的单元。PUMA采用受突变矩阵指导的迭代合并算法,以识别蛋白质单元并将其组织为由可信的突变所链接的家族。这一过程创建了一个层次性谱系,其中父单元及其突变变体共存,同时产生单元词汇表和它们之间的谱系结构。我们验证了PUMA家族在生物学上具有意义;同一PUMA家族内的突变与临床良性变异以及来自高通量实验室的高评分突变相关。此外,这些单元与蛋白质语言模型的上下文偏好相吻合,并映射到已知的功能注释。PUMA的谱系框架提供了具有进化依托的单元,为理解生命之语言提供了一种结构化方法。

关键词

引用

@article{arxiv.2503.08838,
  title  = {PUMA: Discovery of Protein Units via Mutation-Aware Merging},
  author = {Burak Suyunu and Özdeniz Dolu and Ibukunoluwa Abigail Olaosebikan and Hacer Karatas Bristow and Arzucan Özgür},
  journal= {arXiv preprint arXiv:2503.08838},
  year   = {2025}
}

备注

18 pages, 12 figures, 1 table, 1 algorithm