中文

破译自然之语言:一种基于Transformer的蛋白质有害突变语言模型

基因组学 2023-02-13 v4 机器学习 定量方法

摘要

包括深度神经网络模型在内的多种机器学习模型已被开发用于预测错义(非同义)突变的有害性。然而,借助更先进的自适应机器学习方法重新审视这一生物学问题,仍可能为当前最优方法带来潜在改进。自然语言处理领域的近期进展表明,Transformer模型——一种深度神经网络——在建模具有上下文依赖的序列信息方面尤为强大。在本研究中,我们提出MutFormer,一种基于Transformer的错义有害突变预测模型,其以人类基因组的参考蛋白序列与突变蛋白序列作为主要特征。MutFormer结合自注意力层与卷积层,以学习蛋白质序列中氨基酸突变的长程与短程依赖关系。在本研究中,我们首先在人群常见遗传变异产生的参考蛋白序列与突变蛋白序列上对MutFormer进行预训练。接着,我们考察了不同的微调方法,以成功将该模型应用于错义突变的有害性预测。最后,我们在多个测试数据集上评估了MutFormer的性能。我们发现,MutFormer在多种现有工具(包括采用传统机器学习方法的工具)上表现出相当或更优的性能。我们得出结论:MutFormer成功考虑了既往研究未探索的序列特征,并可能补充现有的计算预测或经验生成的功能评分,从而增进我们对疾病变异的理解。

关键词

引用

@article{arxiv.2110.14746,
  title  = {Deciphering the Language of Nature: A transformer-based language model for deleterious mutations in proteins},
  author = {Theodore Jiang and Li Fang and Kai Wang},
  journal= {arXiv preprint arXiv:2110.14746},
  year   = {2023}
}

备注

The main text has 43 pages, 5 figures and 3 tables