中文

MatSciBench:大语言模型在材料科学推理能力的基准测试

人工智能 2025-10-15 v1

摘要

大语言模型 (LLM) 在科学推理方面展现出惊人的能力,但其在材料科学领域的推理能力仍未得到充分探索。为填补这一空白,我们引入MatSciBench,一个涵盖材料科学基本子学科的综合性大学水平基准,包含1,340个问题。MatSciBench具备结构化且细致的分类体系,将材料科学问题划分为6个主要领域和31个子领域,并包含基于解决每个问题所需推理长度的三个难度等级。MatSciBench提供详细的参考解答,实现精确的错误分析,并通过大量问题中的视觉上下文实现多模态推理。对领先模型的评估显示,,即便是最高性能的模型Gemini-2.5-Pro在大学水平材料科学问题上也仅 achieving below 80%的准确率,凸显了MatSciBench的复杂性。我们系统分析了不同的推理策略——基本链式思维、工具增强和自我纠正——发现没有单一方法在所有情景中都表现出色。我们进一步按难度水平分析性能,检讨效率与准确率之间的权衡,突出多模态推理任务的挑战,对LLM和推理方法之间的故障模式进行分析,并评估检索增强生成的影响。MatSciBench因此为评估和推动LLM在材料科学领域科学推理能力的改进提供了全面且稳固的基准框架。

关键词

引用

@article{arxiv.2510.12171,
  title  = {MatSciBench: Benchmarking the Reasoning Ability of Large Language Models in Materials Science},
  author = {Junkai Zhang and Jingru Gan and Xiaoxuan Wang and Zian Jia and Changquan Gu and Jianpeng Chen and Yanqiao Zhu and Mingyu Derek Ma and Dawei Zhou and Ling Li and Wei Wang},
  journal= {arXiv preprint arXiv:2510.12171},
  year   = {2025}
}