CrystalXRD-Bench:面向多样晶体材料 XRD 峰索引基准测试
人工智能
2026-05-29 v1
摘要
从粉末 XRD 模式中识别 Miller 标志需要超越现有多模态基准测试所未检测到的能力:模型必须从渲染的科学曲线中读取狭窄峰位置,然后将该观察与多步骤晶体学推理相连接。我们引入 CrystalXRD-Bench,一个由 10 个公开晶体学数据库构建的 250 样本基准测试,用于单一任务:恢复 XRD 模式中最高强度峰贡献的完整 HKL 集合。每个样本将渲染的 XRD 图像与来源 CIF 文本和化学公式配对,因此可逐个检查视觉提取错误和推理错误。我们评估了七个视觉-语言模型。最佳 Jaccard 分数为 0.5888(GPT-5.4),精确匹配率为 37.6%,但六个七个模型的 Jaccard 分数均低于 0.50;该任务尚未得到解决。错误模式呈系统性变化:双峰案例尤其脆弱,召回率较高的模型通过过度预测 HKL 来提升覆盖率,访问 CIF 文本并不闭合晶体学计算的差距。除了模型排名外,基准测试还识别了当前 VLM 在定量科学图表上失败的条件。所有数据和评估代码将公开可用。
引用
@article{arxiv.2605.29446,
title = {CrystalXRD-Bench: Benchmarking Vision-Language Models for XRD Peak Indexing Across Diverse Crystalline Materials},
author = {Chengliang Xu and Xiaogang Li and Peiyao Xiao and Beng Wang and Hu Wei and Bing Zhao},
journal= {arXiv preprint arXiv:2605.29446},
year = {2026}
}
备注
18 pages, 10 figures