MolLangBench:面向语言提示下分子结构识别、编辑与生成的综合基准
计算与语言
2026-03-24 v4 人工智能
机器学习
生物大分子
摘要
精确识别、编辑和生成分子是化学家和面向化学任务的 AI 系统的 essential 前提。我们提出 MolLangBench,一个综合性基准,用于评估分子语言界面任务:语言提示下的分子结构识别、编辑和生成。为确保高质量、无歧义且确定性的输出,我们使用自动化计算化学工具构建识别任务,并通过严格的专家标注和验证策划编辑和生成任务。MolLangBench 支持评估与不同分子表示形式(包括线性字符串、分子图像和分子图)进行语言接口的模型。对最新模型的评估揭示了显著局限性:最强模型 (GPT-5) 在识别和编辑任务上分别 achieves 86.2% 和 85.5% 的准确率,这些任务对人类而言都 intuitively 简单,而在生成任务上效果更差,仅达到 43.0% 的准确率。这些结果凸显了当前 AI 系统在处理甚至最基础的分子识别和操作任务方面的不足。我们希望 MolLangBench 将催化进一步的研究,以开发更有效更可靠的化学应用 AI 系统。该数据集和代码可访问于 https://huggingface.co/datasets/ChemFM/MolLangBench 和 https://github.com/TheLuoFengLab/MolLangBench。
引用
@article{arxiv.2505.15054,
title = {MolLangBench: A Comprehensive Benchmark for Language-Prompted Molecular Structure Recognition, Editing, and Generation},
author = {Feiyang Cai and Jiahui Bai and Tao Tang and Guijuan He and Joshua Luo and Tianyu Zhu and Srikanth Pilla and Gang Li and Ling Liu and Feng Luo},
journal= {arXiv preprint arXiv:2505.15054},
year = {2026}
}
备注
ICLR-2026 Camera-Ready version