中文

将大型语言模型基于反应知识图谱以用于合成检索

人工智能 2026-01-23 v1

摘要

大型语言模型(LLM)可以辅助化学中的合成规划,但标准的提示方法常常产生幻觉或过时的建议。我们通过将反应路径检索转化为 Text2Cypher(自然语言到图查询)生成问题,研究了 LLM 与反应知识图谱的交互,并定义了单步和多步检索任务。我们比较了零样本提示与使用静态、随机和基于嵌入的示例选择的一次样本变体,并评估了一个由检查表驱动的验证器/校正器循环。为了评估我们的框架,我们考虑了查询有效性和检索准确性。我们发现,使用对齐示例的一次样本提示始终表现最佳。我们的检查表式自校正循环主要提高了零样本设置中的可执行性,并且在存在良好示例的情况下,提供的额外检索增益有限。我们提供了一个可复现的 Text2Cypher 评估设置,以促进基于知识图谱的 LLM 用于合成规划的进一步工作。代码可在 https://github.com/Intelligent-molecular-systems/KG-LLM-Synthesis-Retrieval 获取。

关键词

引用

@article{arxiv.2601.16038,
  title  = {Grounding Large Language Models in Reaction Knowledge Graphs for Synthesis Retrieval},
  author = {Olga Bunkova and Lorenzo Di Fruscia and Sophia Rupprecht and Artur M. Schweidtmann and Marcel J. T. Reinders and Jana M. Weber},
  journal= {arXiv preprint arXiv:2601.16038},
  year   = {2026}
}

备注

Accepted at ML4Molecules 2025 (ELLIS UnConference workshop), Copenhagen, Denmark, December 2, 2025. Workshop page: https://moleculediscovery.github.io/workshop2025/