中文

PepDoRA:基于权重分解低秩适应的统一多肽语言模型

生物大分子 2024-10-29 v1

摘要

多肽疗法,包括大环多肽、多肽抑制剂和生物活性线性多肽,由于其独特的理化性质,在治疗开发中发挥着关键作用。然而,预测这些性质仍然具有挑战性。虽然基于结构的模型主要关注局部相互作用,但语言模型能够捕获修饰和线性多肽的全局治疗性质。像 ESM-2 这样的蛋白质语言模型虽然对天然多肽有效,但无法编码化学修饰。相反,预训练的化学语言模型在表示小分子性质方面表现出色,但并未针对多肽进行优化。为了弥合这一差距,我们引入了 PepDoRA,一个统一的多肽表示模型。利用权重分解低秩适应(DoRA),PepDoRA 在掩码语言模型目标上高效微调 ChemBERTa-77M-MLM,以生成优化的嵌入,用于涉及修饰和未修饰多肽的下游性质预测任务。通过在包含 100,000 个修饰、生物活性和结合多肽的多样化且实验有效的集合上进行微调,我们表明 PepDoRA 嵌入能够捕获输入多肽的功能性质,从而能够准确预测膜渗透性、抗污和溶血倾向,并通过对比学习预测目标蛋白特异性结合。总体而言,通过为化学和生物上多样的多肽提供统一的表示,PepDoRA 作为一个多功能工具用于功能和活性预测,促进了多肽疗法在广泛应用中的开发。

关键词

引用

@article{arxiv.2410.20667,
  title  = {PepDoRA: A Unified Peptide Language Model via Weight-Decomposed Low-Rank Adaptation},
  author = {Leyao Wang and Rishab Pulugurta and Pranay Vure and Yinuo Zhang and Aastha Pal and Pranam Chatterjee},
  journal= {arXiv preprint arXiv:2410.20667},
  year   = {2024}
}