中文

GPCR-BERT:利用蛋白质语言模型解读 G 蛋白偶联受体的序列设计

机器学习 2023-11-01 v1 生物大分子

摘要

随着 Transformer 与大型语言模型(LLM)在化学与生物学中的兴起,科学界开启了治疗剂设计与理解的新途径。蛋白质序列可被建模为语言,并可利用 LLM 的近期进展,特别是鉴于我们可获取丰富的蛋白质序列数据集。在本文中,我们开发了 GPCR-BERT 模型以理解 G 蛋白偶联受体(GPCR)的序列设计。GPCR 是超过三分之一 FDA 批准药物的靶点。然而,关于氨基酸序列、配体选择性与构象基序(如 NPxxY、CWxP、E/DRY)之间关系缺乏全面理解。通过利用预训练蛋白质模型(Prot-Bert)并以基序变异预测任务进行微调,我们得以揭示结合口袋中残基与若干保守基序之间的多种关系。为此,我们利用了注意力权重与模型的隐藏态,将其解读以提取氨基酸在决定被掩码氨基酸类型中的贡献程度。微调模型在预测基序内隐藏残基上展现出高准确率。此外,我们对三维结构上的嵌入进行分析,以阐明受体构象内的高阶相互作用。

关键词

引用

@article{arxiv.2310.19915,
  title  = {GPCR-BERT: Interpreting Sequential Design of G Protein Coupled Receptors Using Protein Language Models},
  author = {Seongwon Kim and Parisa Mollaei and Akshay Antony and Rishikesh Magar and Amir Barati Farimani},
  journal= {arXiv preprint arXiv:2310.19915},
  year   = {2023}
}

备注

25 pages, 5 figures