中文

代理能否为反应定价?评估LLMs在化学成本推理方面的能力

人工智能 2026-05-11 v1

摘要

大型语言模型(LLM)日益成为具备工具使用能力的智能体,但对科学工具使用的严格评估仍有限。在化学领域,近期 agent 能够规划合成路线并调用领域特定工具,但评估往往依赖于精心挑选的演示、专家评估或LLM-as-judge评分,而非基于确切、无评判的ground truth。为弥补这一差距,我们提出化学采购成本估计这一实际任务,要求 agent 必须依据反应描述进行化学身份 grounding、检索供应商报价、选择有效可购包装、归一化数量并计算成本。我们引入ChemCost,包含1,427个可评估反应,基于冻结的定价快照覆盖2,261种化学品和230,775个供应商报价,支持标量评分和阶段级诊断,诊断grounding、检索、采购和算术故障。为评估鲁棒性,我们进一步构建了控制噪声注入视图,通过扰动化学别名、数量表达式、缺失字段和输入格式来测试。对前沿、开源权重和化学专业化LLM agent的实验显示,工具访问是解决任务的必要条件,但并非充分条件。最强 agent 在干净输入上仅以50.6%的准确率(在25%相对误差范围内)完成任务,遇到现实噪声时性能显著下降。阶段级分析进一步表明,故障源于脆弱的解析、无效的证据整合、无效的包装选择以及工具使用的非收敛。

关键词

引用

@article{arxiv.2605.07251,
  title  = {Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning},
  author = {Yuyang Wu and Yue Huang and Shuaike Shen and Xujian Wang and Shuhao Zhang and Qiyao Xue and Weichen Liu and Runtian Gao and Jian Ma and Xiangliang Zhang and Olexandr Isayev},
  journal= {arXiv preprint arXiv:2605.07251},
  year   = {2026}
}

备注

9 pages, 5 figures