中文

MolViBench:评估分子 vibe 编码中的大语言模型

计算与语言 2026-05-06 v2

摘要

分子 vibe 编码是一种范式,其中化学家通过与 LLM 交互来生成用于分子任务的可执行程序,成为化学代理(使用预定义工具)的灵活替代方案,使化学家能够表达任意复杂、定制化的工作流程。与常规编码任务不同,分子编码提出了 LLM 必须同时具备编程、分子理解和领域特定推理能力的独特挑战。然而,现有基准彼此脱节。常规代码生成基准如 HumanEval 和 SWE-bench 不需要化学知识,而化学导向基准如 S^2-Bench 和 ChemCoTBench 则评估知识记忆或属性预测,而非可执行代码生成。为填补这一差距,我们引入了 MolViBench,即首个针对分子 vibe 编码的基准。MolViBench 包含 358 个精选任务,分为五个认知水平,涵盖从单 API 记忆到端到端虚拟筛选管线设计,涉及 12 个真实世界的药物发现工作流程。为严格评估生成的代码,我们还提出了一个多层次评估框架,将类型感知输出比较与 AST 基于 API-语义后备分析相结合,联合衡量可执行性和化学正确性。我们系统评估了 9 个前沿编码 LLM,并比较了三个真实世界的分子 vibe 编码范式,为诊断 LLM 在 AI 加速分子发现中的编码能力提供了一个实用且细粒度的测试基准。

关键词

引用

@article{arxiv.2605.02351,
  title  = {MolViBench: Evaluating LLMs on Molecular Vibe Coding},
  author = {Jiatong Li and Yuxuan Ren and Weida Wang and Changmeng Zheng and Xiao-yong Wei and Qing Li and Yatao Bian},
  journal= {arXiv preprint arXiv:2605.02351},
  year   = {2026}
}

备注

Github Link: https://github.com/phenixace/MolViBench-open