中文

单步反应合成基准:重新思考大语言模型的单答案问题

机器学习 2026-02-04 v1 人工智能 计算工程、金融与科学 计算与语言

摘要

近期进展扩展了大型语言模型(LLM)在药物发现中,包括合成规划的应用。然而,反应合成性能的客观评估仍受限于现有方法。现有基准和指标通常依赖于已发布的合成程序和基于单个真实答案的Top-K准确率,这并未捕捉到真实世界合成规划的开放性。我们提出了一种新的单步骤反应合成基准框架,用于评估通用型和化学专业化LLM,采用ChemCensor作为化学可行性的新型指标。通过强调可行性而非精确匹配,这种方法更符合人类合成规划实践。我们还引入了CREED,即一套数以百万计的ChemCensor验证的反应记录,用于LLM训练,并用于训练一个在本基准下优于LLM基线的模型。

关键词

引用

@article{arxiv.2602.03554,
  title  = {When Single Answer Is Not Enough: Rethinking Single-Step Retrosynthesis Benchmarks for LLMs},
  author = {Bogdan Zagribelnyy and Ivan Ilin and Maksim Kuznetsov and Nikita Bondarev and Roman Schutski and Thomas MacDougall and Rim Shayakhmetov and Zulfat Miftakhutdinov and Mikolaj Mizera and Vladimir Aladinskiy and Alex Aliper and Alex Zhavoronkov},
  journal= {arXiv preprint arXiv:2602.03554},
  year   = {2026}
}