面向自动复现的多模态材料数据与工作流的本体对齐结构化与重用
材料科学
2026-01-21 v1 人工智能
摘要
计算结果的复现性在材料科学中仍然是一个挑战,因为模拟工作流和参数通常仅以非结构化的文本和表格形式报告。虽然文献数据对于验证和重用很有价值,但缺乏机器可读的工作流描述阻碍了大规模的整理和系统比较。现有的文本挖掘方法不足以提取完整的计算工作流及其相关参数。本文介绍了一个基于本体驱动、大语言模型(LLM)辅助的框架,用于从文献中自动提取和结构化计算工作流。该方法聚焦于密排六方镁及其二元合金中基于密度泛函理论的堆垛层错能(SFE)计算,并采用多阶段过滤策略以及针对方法章节和表格的、经过提示工程优化的LLM提取。提取的信息被统一到一个规范模式中,并与已建立的材料本体(CMSO、ASMO和PLDO)对齐,从而能够使用atomRDF构建知识图谱。由此产生的知识图谱能够系统比较已报道的SFE值,并支持计算协议的结构化重用。虽然完全的计算复现性仍受限于缺失或隐式的元数据,但该框架为以语义可互操作的形式组织和情境化已发表结果奠定了基础,从而提高了计算材料数据的透明度和可重用性。
引用
@article{arxiv.2601.12582,
title = {Ontology-aligned structuring and reuse of multimodal materials data and workflows towards automatic reproduction},
author = {Sepideh Baghaee Ravari and Abril Azocar Guzman and Sarath Menon and Stefan Sandfeld and Tilmann Hickel and Markus Stricker},
journal= {arXiv preprint arXiv:2601.12582},
year = {2026}
}
备注
39 pages, 7 figures