蛋白质家族中的系统发育校正与高阶序列统计:Potts模型与MSA Transformer
生物物理
2025-10-28 v1 种群与进化
摘要
应用于蛋白质多序列比对(MSA)数据集的近期生成学习模型包括简单且可解释的基于物理的Potts协变模型以及其他机器学习模型如MSA Transformer(MSA-T)。最佳模型能够准确再现蛋白质中生物物理约束诱导的MSA统计量,这引发了哪种函数形式最能模拟底层物理的问题。Potts模型通常由包含残基-残基相互作用项的有效势来指定,但已有研究表明MSA-T可以捕获由包含多于两两相互作用的效应势诱导的效应,并隐式地考虑MSA中的系统发育结构。在这里,我们比较了Potts模型和MSA-T重建反映复杂生物序列约束的高阶序列统计量的能力。我们发现模型性能很大程度上取决于对序列之间系统发育关系的处理,这可能在MSA中诱导非生物物理的突变协变。当使用对系统发育依赖性的显式校正时,我们发现Potts模型在检测具有生物物理起源的上位相互作用方面优于MSA-T。
引用
@article{arxiv.2503.00289,
title = {Phylogenetic Corrections and Higher-Order Sequence Statistics in Protein Families: The Potts Model vs MSA Transformer},
author = {Kisan Khatri and Ronald M. Levy and Allan Haldane},
journal= {arXiv preprint arXiv:2503.00289},
year = {2025}
}
备注
7 pages, 5 figures, Also presented in BPS2025 Annual Meeting, Los Angeles, California