使用基于本体的自动化方法从规范性文档中提取技术信息:ISO 15531 MANDATE 标准的应用——方法学与初步结果
软件工程
2018-06-19 v2 人工智能
摘要
随着国际标准化机构制定的标准的数量和规模不断增加,它们所面临的问题变得日益关键。有时,负责标准制定的委员会之间缺乏协调也可能导致文档中出现重叠、错误或不兼容。本研究的目的是提出一种方法学,通过使用来自自然语言处理领域的语义工具,实现从规范性文档中自动提取技术概念(术语)。本文第一部分描述了标准化世界的结构、工作方式及其面临的问题;随后介绍了语义标注、信息提取的概念以及该领域可用的软件工具。下一节解释了本体的概念及其在标准化领域的潜在应用。我们在此提出了一种方法学,能够根据参考本体进行的语义标注过程,从给定的规范语料库中提取技术信息。对 ISO 15531 MANDATE 语料库的应用提供了本文所述方法学的首个用例。本文最后描述了该方法产生的初步实验结果,以及一些问题和展望,特别是其应用于其他标准和/或技术委员会的可能性,以及创建预定义技术术语词典的可能性。
引用
@article{arxiv.1806.02242,
title = {Extraction Of Technical Information From Normative Documents Using Automated Methods Based On Ontologies : Application To The Iso 15531 Mandate Standard - Methodology And First Results},
author = {A. F. Cutting-Decelle and A. Digeon and R. I. Young and J. L. Barraud and P. Lamboley},
journal= {arXiv preprint arXiv:1806.02242},
year = {2018}
}
备注
28 pages, 11 figures