蛋白适应性度估计的“一举数完”伪不确定性方法
生物大分子
2024-07-11 v1 基因组学
摘要
蛋白语言模型通过掩码语言建模目标学习预测隐藏氨基酸残基身份的能力,这些模型通过将残基嵌入高维空间来实现,从而封装相关的上下文线索。这些嵌入向量不仅有助于满足定义的训练目标,还可用于其他任务。我们提出了一种方案,使用未被掩码的序列嵌入来估计对应掩码概率向量,这允许在单次通过语言模型前向传播中估计序列的伪不确定性,这一度量可用于适应性度量。我们发现,ESM2 OFS 伪不确定性在适应性度估计方面几乎与真实伪不确定性相当,而且更值得注意的是,它在 ProteinGym Indels 基准测试中定义了新的最佳水平。令人印象深刻的适应性表现促使我们调查其是否可用于检测重建祖先序列中报告的提升稳定性。我们发现,该度量将祖先重建排序为高于现存序列的适应性。最后,我们表明,该技术的计算效率使得能够使用蒙特卡洛方法快速探索功能序列空间成为可能。
关键词
引用
@article{arxiv.2407.07265,
title = {Pseudo-perplexity in One Fell Swoop for Protein Fitness Estimation},
author = {Pranav Kantroo and Günter P. Wagner and Benjamin B. Machta},
journal= {arXiv preprint arXiv:2407.07265},
year = {2024}
}