Speak-to-Structure:评估大语言模型在开放域自然语言驱动的分子生成中的表现
计算与语言
2026-05-25 v4
摘要
最近,大语言模型(LLMs)在自然语言驱动的分子发现中展现出巨大潜力。然而,现有的分子-文本对齐数据集和基准主要基于一对一映射,衡量LLMs检索单个预定义答案的能力,而非其生成多样化但同样有效的候选分子的创造性潜力。为填补这一关键空白,我们提出了Speak-to-Structure(S^2-Bench),这是首个评估LLMs在开放域自然语言驱动分子生成中的基准。S^2-Bench专门针对一对多关系设计,挑战LLMs展现真正的分子理解和开放域生成能力。我们的基准包括三个关键任务:分子编辑(MolEdit)、分子优化(MolOpt)和定制分子生成(MolCustom),每个任务探究分子发现的不同方面。我们还引入了OpenMolIns,一个大规模指令微调数据集,使Llama3.1-8B在S^2-Bench上超越了最强大的LLMs如GPT-4o和Claude-3.5。我们对31个LLMs的全面评估将焦点从简单的模式回忆转向现实的分子设计,为更强大的LLMs在自然语言驱动的分子发现中铺平了道路。我们的代码和数据集完全可通过Github仓库和Huggingface数据集访问。
引用
@article{arxiv.2412.14642,
title = {Speak-to-Structure: Evaluating LLMs in Open-domain Natural Language-Driven Molecule Generation},
author = {Jiatong Li and Junxian Li and Weida Wang and Yunqing Liu and Changmeng Zheng and Yatao Bian and Dongzhan Zhou and Xiao-yong Wei and Qing Li},
journal= {arXiv preprint arXiv:2412.14642},
year = {2026}
}
备注
Accepted by KDD 2026. Our codes and datasets are fully accessible through the https://github.com/phenixace/S2-TOMG-Bench and https://huggingface.co/datasets/phenixace/S2-TOMG-Bench