中文

语言模型驱动:基于结构与性质双约束的 PROTAC 生成管线

定量方法 2024-12-16 v1 人工智能

摘要

不完善的三元复合物建模限制了计算机辅助药物发现工具在 PROTAC 研究与开发中的应用。本研究开发了一种基于语言模型的 PROTAC 分子设计管线,命名为 LM-PROTAC,即语言模型驱动的 Proteolysis Targeting Chimera,通过将基于 Transformer 的生成模型嵌入双约束(结构与性质)来实现。该研究利用分子片段表示,开发了语言模型驱动的管线。首先,开发语言模型驱动的亲和力模型用于筛选针对目标蛋白具有高亲和力的分子片段。其次,在生成过程中约束这些片段的结构和理化性质,以满足特定场景的要求。最后,使用多维度属性预测模型对初步生成的分子进行两轮筛选,生成一批能够降解疾病相关目标蛋白的 PROTAC 分子,用于体外实验验证,从而实现了 AI 辅助 PROTAC 药物生成的完整解决方案。以肿瘤关键靶标 Wnt3a 为例,LM-PROTAC 管线成功生成能够抑制 Wnt3a 的 PROTAC 分子。结果表明,DCT 能有效生成靶向并水解 Wnt3a 的 PROTAC。

关键词

引用

@article{arxiv.2412.09661,
  title  = {Language model driven: a PROTAC generation pipeline with dual constraints of structure and property},
  author = {Jinsong Shao and Qineng Gong and Zeyu Yin and Yu Chen and Yajie Hao and Lei Zhang and Linlin Jiang and Min Yao and Jinlong Li and Fubo Wang and Li Wang},
  journal= {arXiv preprint arXiv:2412.09661},
  year   = {2024}
}

备注

61 pages,12 figures