MaterioMiner——基于本体的文本挖掘数据集,用于提取工艺-结构-性能实体
计算与语言
2024-08-12 v1 材料科学
摘要
虽然大型语言模型能够学习语言及其中的信息的健全统计表示,但本体是能够理想补充前者的符号知识表示。在此关键交叉点上,研究依赖于将本体与文本语料库相结合的数据集,以实现神经符号模型的训练和全面基准测试。我们提出MaterioMiner数据集及其关联的材料力学本体,其中本体概念来自材料力学领域与文献语料库中的文本实体相关联。数据集的另一个独特特征是其极细粒度标注。具体而言,三个标注者在四篇文献中对179个不同类别进行手动标注,总计标注并编辑了2191个实体。我们提出了对因果构成-工艺-微结构-性能关系的符号表示。我们探讨了三个标注者之间的标注一致性,并对预训练模型进行微调,以展示命名实体识别模型训练的可行性。重用该数据集可促进材料语言模型的训练和基准测试、自动本体构建以及从文本数据中生成知识图谱。
引用
@article{arxiv.2408.04661,
title = {MaterioMiner -- An ontology-based text mining dataset for extraction of process-structure-property entities},
author = {Ali Riza Durmaz and Akhil Thomas and Lokesh Mishra and Rachana Niranjan Murthy and Thomas Straub},
journal= {arXiv preprint arXiv:2408.04661},
year = {2024}
}