探索大型语言模型在材料科学与冶金工程中的专业能力
计算物理
2025-01-09 v1 材料科学
摘要
人工智能的集成正快速增加各个领域的应用,大型语言模型(LLM)在众多应用中日益普及。本工作是整体项目的一部分,该项目旨在为材料科学领域训练专门的 LLM。为评估这种专业化培训的影响,建立材料科学中现有 LLM 的基准性能是必不可少的。在本研究中,我们使用包含材料科学和冶金工程问题的 MaScQA 问答(Q&A)基准对 15 个不同的 LLM 进行评估。该基准包含来自工程师入门考试(GATE)的问题,旨在测试模型在材料科学和冶金工程问题回答方面的能力。我们的结果表明,封闭源 LLM 如 Claude-3.5-Sonnet 和 GPT-4 在整体准确率上达到约 84%,而开源模型 Llama3-70b 和 Phi3-14b 分别 tops at 约 56% 和 43%。这些发现为在材料科学中应用于 Q&A 任务的 LLM 提供了基准性能,并强调了通过提示工程和微调策略对开源模型实现显著提升的潜力。我们预计这项工作将推动 LLM 作为材料科学中有价值助手的采用,展示其在该专业领域及相关子领域中的实用性。
引用
@article{arxiv.2501.04277,
title = {Exploring the Expertise of Large Language Models in Materials Science and Metallurgical Engineering},
author = {Christophe Bajan and Guillaume Lambard},
journal= {arXiv preprint arXiv:2501.04277},
year = {2025}
}
备注
13 pages, 6 figures, 5 tables, accepted in Digital Discovery