中文

OPENXRD:面向 LLM/MLLM XRD 问答的综合基准框架

计算与语言 2026-03-11 v2 人工智能

摘要

我们介绍 OPENXRD,一个用于评估大语言模型(LLM)和多模态大语言模型(MLLM)在晶体学问答中的综合基准框架。该框架衡量上下文吸收程度,即模型在推理过程中如何使用固定、领域特定的支持信息。该框架包含 217 个专家精选的 X 射线衍射(XRD)问题,覆盖从基础到高级的晶体学概念,分别在无上下文(闭卷书)和有上下文(开卷书)条件下进行评估,后者包括由 GPT-4.5 生成并由晶体学专家校订的简洁参考段落。我们对 74 个最新 LLM 和 MLLM(包括 GPT-4、GPT-5、O 系列、LLaVA、LLaMA、QWEN、Mistral 和 Gemini 系列)进行基准测试,量化不同架构和规模如何吸收外部知识。结果表明,中等规模模型(7B--70B 参数)从上下文材料中获得的提升最大,而非常大规模模型常常出现饱和或干扰,最大的相对提升出现在小型和中等规模模型中。专家审核的材料比 AI 生成的材料提供了显著更高的改进,即使 token 数相同,也确认了内容质量而非数量是驱动性能的关键因素。OPENXRD 为评估科学领域中推理、知识集成和指导敏感性提供了可复现的诊断性基准,并为未来的多模态和检索增强型晶体学系统奠定了基础。

关键词

引用

@article{arxiv.2507.09155,
  title  = {OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering},
  author = {Ali Vosoughi and Ayoub Shahnazari and Yufeng Xi and Zeliang Zhang and Griffin Hess and Chenliang Xu and Niaz Abdolrahim},
  journal= {arXiv preprint arXiv:2507.09155},
  year   = {2026}
}

备注

Accepted at Digital Discovery (Royal Society of Chemistry)