中文

基于蛋白质序列的强化学习模型用于广泛且快速的全新药物设计

生物大分子 2022-09-16 v1 机器学习

摘要

全新分子设计促进了大规模化学空间的探索,从而加速药物发现。基于结构的全新方法通过将药物-靶标相互作用纳入深度生成架构,可以克服活性配体数据稀缺的问题。然而,这些策略受到实验测定的蛋白质或复合物结构比例较小的瓶颈限制。此外,由于分子和蛋白质均采用三维表示,分子生成的计算成本昂贵。在此,我们展示了一个广泛适用且快速的基于蛋白质序列的强化学习(RL)模型用于药物发现。在生成模型中,奖励组件之一的结合亲和力预测器基于一维蛋白质序列和分子SMILES。作为概念验证,该RL模型被用于为四个靶标设计分子。所生成的化合物通过QSAR和基于实验三维结合口袋的分子对接验证,显示出生物活性。我们还发现,生成分子的性能取决于结合预测器训练数据源的选择。此外,利用我们的模型研究了无任何实验结构的激酶CDK20的药物设计。仅以一维蛋白质序列作为输入,所生成的新型化合物基于AlphaFold预测结构显示出良好的结合亲和力。

关键词

引用

@article{arxiv.2209.07405,
  title  = {Widely Used and Fast De Novo Drug Design by a Protein Sequence-Based Reinforcement Learning Model},
  author = {Yaqin Li and Lingli Li and Yongjin Xu and Yi Yu},
  journal= {arXiv preprint arXiv:2209.07405},
  year   = {2022}
}