RetroReasoner:用于战略性反向合成预测的推理型大语言模型
机器学习
2026-03-16 v1 人工智能
摘要
反向合成预测是有机合成中的核心任务,旨在为给定的产物分子预测反应物。传统方法需要化学家选择合理的键断裂点并推导相应的反应物,这既耗时又需要 substantial 专业知识。虽然近期在分子大语言模型(LLM)方面取得了进展,但许多方法要么在没有战略推理的情况下预测反应物,要么仅进行通用的产物分析,未能对导致特定反应物选择的键断裂策略进行明确推理。为克服这些限制,我们提出了 RetroReasoner—a 一种基于化学家战略思维的反向合成推理模型。RetroReasoner 使用监督微调(SFT)和强化学习(RL)进行训练。对于 SFT,我们引入 SyntheticRetro—a 一种生成结构化断裂理由框架,同时预测反应物。在 RL 框架下,我们采用轮询准确率作为奖励机制,将预测的反应物输入正向合成模型,若正向预测的产物与原始输入产物匹配,则给予奖励。实验结果表明,RetroReasoner 不仅超越了先前的基线方法,还生成了更广泛的可行反应物提议,尤其在处理更具挑战性的反应实例方面表现突出。
引用
@article{arxiv.2603.12666,
title = {RetroReasoner: A Reasoning LLM for Strategic Retrosynthesis Prediction},
author = {Hanbum Ko and Chanhui Lee and Ye Rin Kim and Rodrigo Hormazabal and Sehui Han and Sungbin Lim and Sungwoong Kim},
journal= {arXiv preprint arXiv:2603.12666},
year = {2026}
}
备注
26 pages, 18 figures