中文

用于端到端逆合成规划的强化推理

人工智能 2026-04-01 v1

摘要

逆合成规划是有机化学中的基本任务,但由于其组合复杂性而仍然具有挑战性。为解决此问题,传统方法通常依赖混合框架,将单步预测与外部搜索启发式相结合,不可避免地破坏了局部分子变换与全局规划目标之间的逻辑连贯性。为弥合这一差距并将复杂的策略远见直接嵌入模型的化学推理中,我们引入了ReTriP,一个将逆合成重新表述为直接思维链推理任务的端到端生成框架。我们建立了路径一致的分子表示,并采用渐进式训练课程,从推理蒸馏过渡到具有可验证奖励的强化学习,有效地将逐步生成与实际路线效用对齐。在RetroBench上的经验评估表明,ReTriP达到了最先进的性能,在长时序规划方面表现出优于混合基线的鲁棒性。

关键词

引用

@article{arxiv.2603.29723,
  title  = {Reinforced Reasoning for End-to-End Retrosynthetic Planning},
  author = {Chenyang Zuo and Siqi Fan and Yizhen Luo and Zaiqing Nie},
  journal= {arXiv preprint arXiv:2603.29723},
  year   = {2026}
}