用于从科学文献中自动生成数据库的无规则工作流
材料科学
2024-02-07 v3 计算物理
数据分析、统计与概率
摘要
近来,Transformer网络在广泛的自然语言处理任务中取得了最先进的性能。本文提出一种基于BERT模型针对不同下游任务微调的工作流,从而可从科学文献中非结构化的自然语言里自动抽取结构化信息。与现有从类似来源自动抽取结构化化合物-性质关系的方法不同,我们的工作流不依赖于复杂语法规则的定义。因此,它可适配新任务而无需大量实现工作与知识。我们通过自动生成居里温度数据库与带隙数据库来测试该数据抽取工作流。随后将这些数据库与人工整理的数据集以及用最先进基于规则的方法所获得的数据集进行比较。此外,为展示自动抽取数据在材料设计工作流中的实际效用,我们用其构建机器学习模型来预测居里温度与带隙。总体而言我们发现,尽管噪声更多,自动抽取的数据集在体量上可快速增长,且此体量在下游任务中部分补偿了不准确性。
引用
@article{arxiv.2301.11689,
title = {A rule-free workflow for the automated generation of databases from scientific literature},
author = {Luke P. J. Gilligan and Matteo Cobelli and Valentin Taufour and Stefano Sanvito},
journal= {arXiv preprint arXiv:2301.11689},
year = {2024}
}
备注
19 pages, 11 figures