利用大语言模型从材料科学文献中挖掘实验数据:一项评估研究
计算与语言
2024-06-03 v3
摘要
本研究旨在评估 GPT-3.5-Turbo、GPT-4 和 GPT-4-Turbo 等大语言模型从材料科学科学文献中提取结构化信息的能力。为此,我们主要关注信息提取的两个关键任务: 所研究材料与物理性质的命名实体识别(NER); 这些实体之间的关系抽取(RE)。由于材料信息学(MI)领域明显缺乏数据集,我们使用了基于超导体研究的 SuperMat 和通用测量评估语料库 MeasEval 进行评估。我们将 LLM 执行这些任务的性能与基于 BERT 架构和基于规则的方法(基线)进行了基准比较。我们引入了一种用于复杂材料表达式比较分析的新方法,强调化学式的标准化,以应对材料科学信息评估中固有的复杂性。在 NER 任务中,LLM 在零样本提示下的表现未能超越基线,在少样本提示下也仅有有限的提升。然而,针对 RE 任务采用适当策略微调的 GPT-3.5-Turbo 优于包括基线在内的所有模型。在没有任何微调的情况下,GPT-4 和 GPT-4-Turbo 仅在提供少量示例后便展现出卓越的推理和关系抽取能力,超越了基线。总体而言,结果表明,尽管 LLM 在连接概念方面展现出相关的推理技能,但对于需要提取复杂领域特定实体(如材料)的任务,专用模型目前是更好的选择。这些见解为未来工作在其他材料科学子领域的应用提供了初步指导。
引用
@article{arxiv.2401.11052,
title = {Mining experimental data from Materials Science literature with Large Language Models: an evaluation study},
author = {Luca Foppiano and Guillaume Lambard and Toshiyuki Amagasa and Masashi Ishii},
journal= {arXiv preprint arXiv:2401.11052},
year = {2024}
}
备注
40 pages: 5 figures and 1 table in the body. 32 Tables in the Appendix / Supplementary materials