SMDD-Bench:LLM 是否能解决真实世界的小分子药物设计任务?
人工智能
2026-05-26 v2
摘要
LLM 代理在科学发现中的潜力巨大。然而,LLM 代理在真实世界的小分子药物设计 (SMDD) 任务中所表现如何,尤其是在多样化的化学结构和靶点上,尚不清晰。当前的评估方法要么是 ad hoc 的,要么过于简单不符合真实世界发现,规模有限,或限制于单轮问答。在标准化评估 LLM 代理在小分子设计任务方面性能方面,我们引入 SMDD-Bench,一个具有挑战性的、多轮的、长期程度的代理基准,包含 502 个保证可解的任务实例,涵盖 5 种任务类型:2D 药理构象识别、相互作用点发现、骨架跳跃、铅优化和片段装配。SMDD-Bench 任务涵盖化学空间的广泛区域,涉及 102 个独特的蛋白靶点。完全解决该基准需要具备强大的化学和生物推理能力、3D 直觉、理解专业工具使用并在有限的 oracle 调用次数内展现规划技能。我们对 7 个前沿开源和闭源 LLM 进行基准测试,发现即使是最具性能的 LLM GPT5.4 也仅解决了 40.2% 的任务。我们希望 SMDD-Bench 提供一个标准化的测试平台,以激励该领域致力于训练和评估 LLM 代理以实现完全自主的计算药物设计。我们在 smddbench.com 上维护公开的排行榜。
引用
@article{arxiv.2605.21740,
title = {SMDD-Bench: Can LLMs Solve Real-World Small Molecule Drug Design Tasks?},
author = {Kevin Han and Renfei Zhang and Kathy Wei and Hamed Mahdavi and Niloofar Mireshghallah and Amir Barati Farimani},
journal= {arXiv preprint arXiv:2605.21740},
year = {2026}
}