从材料科学文献中提取过程-结构-性质关系的结构化抽取方法
计算与语言
2025-09-30 v1 材料科学
信息检索
摘要
随着大语言模型(LLM)的兴起,数百万篇学术论文中海量的非结构化文本正变得越来越可被用于材料发现,尽管仍存在诸多挑战。虽然LLM提供了有前景的few-shot和zero-shot学习能力,尤其在材料领域中专家标注数据稀缺的情况下尤为宝贵,但通用型LLM往往无法在无进一步适配的情况下解决关键的材料专用查询。为弥合这一差距,对人类标注数据进行细调(fine-tuning)是有效结构化知识抽取的关键。本研究引入了一种新颖的标注模式,用于从科学文献中抽取通用的过程-结构-性质关系。我们采用128篇摘要的数据集进行验证,标注数据来自两个不同的领域:高温材料(Domain I)和材料微结构模拟中的不确定性定量分析(Domain II)。首先,我们基于MatBERT(一种领域特定的BERT变体)开发了条件随机场(CRF)模型,并在Domain I上进行评估。随后,我们在相同条件下将其与调优后的LLM(OpenAI的GPT-4o)进行比较。结果表明,细调LLM在Domain I上显著优于BERT-CRF基线模型。然而,当额外引入Domain II的样本后,BERT-CRF模型的性能与GPT-4o模型相当。这些发现凸显了本文标注模式在结构化知识抽取中的潜力,并突显了两种建模方法的互补优势。
引用
@article{arxiv.2504.03979,
title = {Structured Extraction of Process Structure Properties Relationships in Materials Science},
author = {Amit K Verma and Zhisong Zhang and Junwon Seo and Robin Kuo and Runbo Jiang and Emma Strubell and Anthony D Rollett},
journal= {arXiv preprint arXiv:2504.03979},
year = {2025}
}
备注
16 pages, 3 figures, 13 table