DrugGen 2:一种用于增强药物发现的疾病感知语言模型
定量方法
2026-07-09 v1 人工智能
机器学习
摘要
当前的药物设计计算方法通常侧重于在特定靶点或一般分子性质条件下生成分子,往往忽略了疾病背景对靶点行为和治疗结果的影响。为了解决这一差距,我们引入了DrugGen-2,一种新颖的生成模型,它在疾病本体和靶蛋白序列双重条件下设计小分子。DrugGen-2是通过在批准药物及其相关疾病和靶点的精选数据集上微调预训练的GPT-2模型而开发的,采用了监督微调随后通过组相对策略优化(GRPO)进行强化学习的两步策略。该过程由优化化学有效性、新颖性、多样性和高预测结合亲和力的奖励函数引导。在与糖尿病肾病相关的五个蛋白靶点上进行评估时,DrugGen-2显著优于基线模型(DrugGPT和DrugGen)。它表现出更强的生成独特分子的能力,与批准药物具有更高的结构相似性,并在所有靶点上取得了更好的预测结合亲和力。分子对接分析进一步支持了这些发现,鉴定出具有强结合潜力的候选配体,包括预测亲和力(-9.917、-9.485和-9.367)超过参考药物(如血管紧张素转换酶的依那普利,-8.283)的化合物。通过将疾病特定背景整合到分子生成中,DrugGen-2推进了AI辅助药物发现,为从头设计和考虑疾病与分子靶点之间复杂相互作用的药物重定位提供了一个强大的工具。
引用
@article{arxiv.2607.08404,
title = {DrugGen 2: A disease-aware language model for enhancing drug discovery},
author = {Ali Motahharynia and Mohammadreza Ghaffarzadeh-Esfahani and Mahsa Sheikholeslami and Navid Mazrouei and Matin Irajpour and Yousof Gheisari and Hajar Sirous},
journal= {arXiv preprint arXiv:2607.08404},
year = {2026}
}
备注
15 pages, 2 figures, 1 table, and 4 supplementary files. To use the model, see https://github.com/alimotahharynia/DrugGen-2