中文

基于预训练蛋白质语言模型与对比学习的蛋白质-DNA结合位点预测

生物大分子 2023-06-29 v1 定量方法

摘要

蛋白质-DNA 相互作用对复制、转录和剪接等生命活动至关重要。识别蛋白质-DNA 结合残基对于建模其相互作用及下游研究必不可少。然而,开发准确高效的计算方法来完成该任务仍具挑战性。该领域的改进有望推动生物技术和药物设计中的新应用。本研究提出一种称为 CLAPE 的新方法,结合预训练蛋白质语言模型与对比学习方法预测 DNA 结合残基。我们在蛋白质-DNA 结合位点数据集上训练 CLAPE-DB 模型,并通过多种实验评估模型性能与泛化能力。结果显示,CLAPE-DB 模型在两个基准数据集上的 AUC 值分别达到 0.871 和 0.881,表明其性能优于其他现有模型。CLAPE-DB 展现出更好的泛化能力且对 DNA 结合位点具有特异性。此外,我们在不同的蛋白质-配体结合位点数据集上训练 CLAPE,证明 CLAPE 是一个用于结合位点预测的通用框架。为方便科学界,基准数据集与代码发布于 https://github.com/YAndrewL/clape。

关键词

引用

@article{arxiv.2306.15912,
  title  = {Protein-DNA binding sites prediction based on pre-trained protein language model and contrastive learning},
  author = {Yufan Liu and Boxue Tian},
  journal= {arXiv preprint arXiv:2306.15912},
  year   = {2023}
}