从科学文献中进行过程信息抽取的流水线:面向基于机器学习与数据科学的配方提取
信息检索
2019-12-18 v1 计算与语言
机器学习
摘要
本文描述了一种用于从文档中进行结构化信息抽取的机器学习与数据科学流水线,其实现为一套开源工具及对现有工具的扩展。它围绕一种从已发表科学文献中抽取过程信息的方法学展开,这些信息以配方的形式呈现,即创建制品(此处为合成纳米材料)的逐步流程。从由自由文本生成配方的整体目标出发,我们推导出一个由流水线阶段组成的系统的技术目标:文档获取与过滤、有效载荷抽取、作为关系抽取任务的配方步骤抽取、配方组装,以及通过具备问答(QA)功能的信息检索界面进行呈现。该系统满足元数据驱动的有效载荷抽取、命名实体抽取和文本关系抽取等计算信息与知识管理(CIKM)需求。本文所述的功能性贡献包括用于PDF过滤与有效载荷抽取任务的半监督机器学习方法,随后是始于章节抽取、将配方步骤作为信息元组、最终组装为配方的结构化抽取与数据转换任务。抽取质量的可度量客观标准包括配方步骤的精确率与召回率、顺序约束,以及QA的准确率、精确率与召回率。源自本工作的结果、关键新颖贡献及重要开放问题,围绕将这些整体质量度量归因于流水线的特定机器学习与推理阶段(各阶段均带有其性能度量)而展开。所需配方包含已识别的前置条件、材料输入与操作,并构成我们计算信息与知识管理(CIKM)系统的整体输出。
引用
@article{arxiv.1912.07747,
title = {Pipelines for Procedural Information Extraction from Scientific Literature: Towards Recipes using Machine Learning and Data Science},
author = {Huichen Yang and Carlos A. Aguirre and Maria F. De La Torre and Derek Christensen and Luis Bobadilla and Emily Davich and Jordan Roth and Lei Luo and Yihong Theis and Alice Lam and T. Yong-Jin Han and David Buttler and William H. Hsu},
journal= {arXiv preprint arXiv:1912.07747},
year = {2019}
}
备注
15th International Conference on Document Analysis and Recognition Workshops (ICDARW 2019)