TSSR:用于字符级 SMILES 生成的两阶段交换奖励驱动强化学习
机器学习
2026-01-19 v2 人工智能
摘要
设计可靠、有效且多样的分子是现代药物发现的基础,因为改进的分子生成支持对化学空间进行高效探索以寻找潜在候选药物,并降低早期设计工作的成本。尽管有这些需求,当前将分子生成为 SMILES 字符串的化学语言模型仍易受复合 token 错误的影响:许多样本无法解析或化学上不合理,而旨在防止失败的硬约束可能会限制探索。为了解决这一差距,我们引入了 TSSR,一个用于字符级 SMILES 生成的两阶段、交换奖励驱动强化学习 (RL) 框架。第一阶段奖励修复语法的局部 token 交换,促进从无效字符串到可解析字符串的转换。第二阶段提供来自 RDKit 诊断的化学感知反馈,奖励在化合价、芳香性和连接性问题上的减少。该奖励分解为可解释的项(交换效率、错误减少、与有效性的距离),与模型无关,且不需要特定任务的标签或手工制作的语法。我们在 MOSES 基准上评估了 TSSR,使用通过 PPO 训练的 GRU 策略,分别在从随机初始化开始的纯 RL (P-RL) 和从预训练化学语言模型开始的微调 RL (F-RL) 中进行,每次运行评估 10,000 个生成的 SMILES。在 P-RL 中,TSSR 显著提高了语法有效性、化学有效性和新颖性。在 F-RL 中,TSSR 在提高有效性和新颖性的同时保持了类药性和可合成性。Token 级分析表明,语法编辑和化学修复共同作用以减少 RDKit 检测到的错误。TSSR 将稀疏的终端目标转化为更密集且更易解释的奖励,在不降低多样性的情况下提高了语法和化学质量。TSSR 与数据集无关,可适应各种强化学习方法。
引用
@article{arxiv.2601.04521,
title = {TSSR: Two-Stage Swap-Reward-Driven Reinforcement Learning for Character-Level SMILES Generation},
author = {Jacob Ede Levine and Yun Lyan Luo and Sai Chandra Kosaraju},
journal= {arXiv preprint arXiv:2601.04521},
year = {2026}
}
备注
Under Review