概率蛋白质序列模型的生成能力
机器学习
2022-01-05 v2 数据分析、统计与概率
定量方法
摘要
Potts 模型与变分自编码器(VAEs)近年来作为生成式蛋白质序列模型(GPSMs)在探索适应度景观和预测突变效应方面日益受到关注。尽管取得了令人鼓舞的结果,对 GPSM 生成的概率分布进行定量表征与比较仍然缺乏。目前尚不清楚 GPSM 能否忠实再现自然序列中由于上位效应而产生的复杂多残基突变模式。我们开发了一组序列统计量,以评估近期受关注的三种 GPSM 的“生成能力”:成对 Potts 哈密顿量、VAE 以及位点独立模型,使用的为自然与合成数据集。我们表明,成对 Potts 哈密顿量模型的生成能力最大,因为该模型生成的高阶突变统计量与自然序列中观测到的一致。相比之下,我们表明 VAE 的生成能力介于成对 Potts 与位点独立模型之间。重要的是,我们的工作以我们开发的高阶序列协变统计量来衡量 GPSM 生成能力,并提供了一个评估与解释 GPSM 准确性的新框架,该框架强调了上位效应的作用。
引用
@article{arxiv.2012.02296,
title = {Generative Capacity of Probabilistic Protein Sequence Models},
author = {Francisco McGee and Quentin Novinger and Ronald M. Levy and Vincenzo Carnevale and Allan Haldane},
journal= {arXiv preprint arXiv:2012.02296},
year = {2022}
}