利用预训练生化语言模型进行靶向药物设计
机器学习
2022-09-05 v1 计算与语言
生物大分子
定量方法
机器学习
摘要
动机:开发靶向感兴趣蛋白质的新化合物是制药工业中最重要的任务之一。深度生成模型已应用于靶向分子设计并展现出有前景的结果。近来,靶标特异性分子生成被视为蛋白质语言与化学语言之间的翻译。然而,此类模型受限于可获得的相互作用蛋白质-配体对的数量。另一方面,大量未标记的蛋白质序列与化合物可用,并已被用于训练学习有用表示的语料模型。在本研究中,我们提出利用预训练生化语言模型来初始化(即热启动)靶向分子生成模型。我们考察两种热启动策略:(i) 单阶段策略,其中初始化模型在靶向分子生成上训练;(ii) 两阶段策略,包含在分子生成上的预微调及随后的靶标特异性训练。我们还比较了两种生成化合物的解码策略:束搜索与采样。结果:结果显示热启动模型优于从头训练的基线模型。就基准中广泛使用的指标而言,两种提出的热启动策略彼此取得相似结果。然而,对若干新蛋白质所生成化合物的对接评估表明,单阶段策略比两阶段策略泛化更好。此外,我们观察到在评估化合物质量的对接评估与基准指标中,束搜索均优于采样。可用性与实现:源代码见于 https://github.com/boun-tabi/biochemical-lms-for-drug-design,材料存档于 Zenodo 的 https://doi.org/10.5281/zenodo.6832145。
引用
@article{arxiv.2209.00981,
title = {Exploiting Pretrained Biochemical Language Models for Targeted Drug Design},
author = {Gökçe Uludoğan and Elif Ozkirimli and Kutlu O. Ulgen and Nilgün Karalı and Arzucan Özgür},
journal= {arXiv preprint arXiv:2209.00981},
year = {2022}
}
备注
12 pages, to appear in Bioinformatics