利用部分SMILES验证方案增强强化学习框架中的药物设计
机器学习
2025-05-02 v1 计算工程、金融与科学
生物大分子
摘要
基于SMILES的分子生成已成为药物发现中的一种强大方法。使用大语言模型(LLM)的深度强化学习(RL)已被纳入分子生成过程,以在期望分子候选者的似然性方面实现高匹配分数。然而,该方法的一个关键挑战是RL阶段的灾难性遗忘,即在预训练期间通常超过99%的分子有效性等知识会发生显著退化。目前应用于药物发现的RL算法(如REINVENT)使用先验模型作为锚点以保留预训练知识,但这些方法缺乏鲁棒的探索机制。为了解决这些问题,我们提出了部分SMILES验证-PPO(PSV-PPO),这是一种新颖的RL算法,它结合了实时部分SMILES验证以防止灾难性遗忘,同时鼓励探索。与仅在生成整个序列后才验证分子结构的传统RL方法不同,PSV-PPO在每个自回归步骤执行逐步验证,不仅评估选定的候选词元,还评估源自先前部分序列的所有潜在分支。这使得能够跨所有潜在路径早期检测无效的部分SMILES。因此,即使在广阔化学空间中的激进探索期间,PSV-PPO也能保持高有效率。我们在PMO和GuacaMol基准数据集上的实验表明,PSV-PPO在保持具有竞争力的探索和优化性能的同时,显著减少了无效生成结构的数量。尽管我们的工作主要侧重于保持有效性,但PSV-PPO的框架可在未来的研究中扩展以纳入其他形式的有价值的领域知识,进一步增强强化学习在药物发现中的应用。
引用
@article{arxiv.2505.00530,
title = {Leveraging Partial SMILES Validation Scheme for Enhanced Drug Design in Reinforcement Learning Frameworks},
author = {Xinyu Wang and Jinbo Bi and Minghu Song},
journal= {arXiv preprint arXiv:2505.00530},
year = {2025}
}
备注
17 pages, 5 main figures, 2 appendix figures. Submitted to ICML 2025