面向材料合成的大语言模型基准测试:以原子层沉积为例
机器学习
2025-06-10 v1 材料科学
人工智能
摘要
本工作引入了一个开放式问题基准测试 ALDbench,用于评估大语言模型 (LLM) 在材料合成中的性能,特别是在原子层沉积这一用于能源应用和微电子领域的薄膜生长技术中。我们的基准测试包括难度从研究生水平到领域专家了解最前沿状态的各种问题。人类专家根据难度和具体性性评审问题,并根据整体质量、具体性、相关性和准确性四个标准评估模型响应。我们在 OpenAI GPT-4o 的一个实例上运行了该基准测试。模型的响应在 1 到 5 分尺度上获得了 3.7 的综合质量分数,相当于及格分数。然而,36% 的问题至少有一个以下平均分的得分。对响应进行深入分析识别出至少五起疑似幻觉事件。最后,我们观察到问题难度与响应质量、问题难度与响应相关性以及问题具体性与响应准确性之间存在统计显著相关性。这强调了除了难度或准确性之外,在评估 LLM 时需要跨越多个标准。
引用
@article{arxiv.2412.10477,
title = {Benchmarking large language models for materials synthesis: the case of atomic layer deposition},
author = {Angel Yanguas-Gil and Matthew T. Dearing and Jeffrey W. Elam and Jessica C. Jones and Sungjoon Kim and Adnan Mohammad and Chi Thang Nguyen and Bratin Sengupta},
journal= {arXiv preprint arXiv:2412.10477},
year = {2025}
}