用于从科学文献中高质量结构化数据抽取的半自动暂存区
计算与语言
2023-11-27 v2 超导电性
数据库
机器学习
摘要
我们提出一个用于从文献中高效构建准确的超导体实验物理性质数据库的半自动暂存区,称为 SuperCon2,以丰富现有手工构建的超导体数据库 SuperCon。在此我们报告我们的标注界面(SuperCon2 Interface)以及一个管理工作流,用于管理每条被审查记录的状态转换,以验证在先前工作中使用 Grobid-superconductors 收集的来自 PDF 文档的超导体数据集。该标注工作流允许自动与手动操作,前者包含扫描新数据以识别离群点的“异常检测”,以及基于人工校正收集训练数据样本的“训练数据收集器”机制。这种训练数据收集策略在以较少样本数量改进机器学习模型方面是有效的。对于手动操作,该界面(SuperCon2 界面)通过提供智能界面和增强的 PDF 文档查看器来提高人工校正期间的效率。我们表明,与传统“人工校正”相比,我们的界面通过提升精确率与召回率显著改善了标注质量。我们的半自动方法将为通过科学文档的文本数据挖掘实现可靠数据库提供一种解决方案。
引用
@article{arxiv.2309.10923,
title = {Semi-automatic staging area for high-quality structured data extraction from scientific literature},
author = {Luca Foppiano and Tomoya Mato and Kensei Terashima and Pedro Ortiz Suarez and Taku Tou and Chikako Sakai and Wei-Sheng Wang and Toshiyuki Amagasa and Yoshihiko Takano and Masashi Ishii},
journal= {arXiv preprint arXiv:2309.10923},
year = {2023}
}
备注
5 tables, 6 figures, 18 pages