用于构建自然语言处理贡献知识图谱的句子、短语与三元组标注——一个试验数据集
计算与语言
2021-05-10 v3 数字图书馆
信息检索
摘要
目的:本工作的目标是规范化 NLPCONTRIBUTIONS 方案(以下简称 NLPCONTRIBUTIONGRAPH),通过两阶段标注方法直接从论文句子中对自然语言处理(NLP)学术文献中的贡献信息进行结构化:1)试点阶段——定义方案(已在先前工作中描述);2)裁决阶段——规范化图谱模型(本文重点)。设计/方法/路径:我们针对 50 篇先前已标注的 NLP 学术文献,依据由以贡献为中心的句子、短语和三元组陈述构成的数据流水线,对其贡献相关信息进行二次重新标注。为此,在裁决标注阶段特别注重减少标注噪声,同时为我们提出的新型 NLP 贡献结构化与图谱方案制定指南。研究发现:在 50 篇文献上应用 NLPCONTRIBUTIONGRAPH 最终得到一个包含 900 个以贡献为中心的句子、4,702 个以贡献信息为中心的短语和 2,980 个表层结构三元组的数据集。以 F1 计,句子、短语和三元组陈述在第一阶段与第二阶段之间的标注内一致度分别为 67.92%、41.82% 和 22.31%,表明信息粒度越细,标注决策差异越大。实践意义:我们将 NLPCONTRIBUTIONGRAPH 数据集成到 Open Research Knowledge Graph(ORKG)中——一个基于知识图谱(KG)、可对结构化学术知识进行智能计算的新一代数字图书馆,以此作为辅助研究人员日常工作的可行工具。
引用
@article{arxiv.2010.04388,
title = {Sentence, Phrase, and Triple Annotations to Build a Knowledge Graph of Natural Language Processing Contributions -- A Trial Dataset},
author = {Jennifer D'Souza and Sören Auer},
journal= {arXiv preprint arXiv:2010.04388},
year = {2021}
}
备注
22 pages, 9 figures, 4 tables