NLPContributions:一种用于自然语言处理文献中学术贡献机器阅读的标注方案
摘要
我们描述了一项标注计划,旨在捕获自然语言处理(NLP)文章中的学术贡献,特别是那些讨论用于各类信息抽取任务的机器学习(ML)方法的文章。我们基于对50篇呈现了面向五项信息抽取任务(1. 机器翻译,2. 命名实体识别,3. 问答,4. 关系分类,5. 文本分类)贡献的NLP-ML学术文章的试点标注工作,开发了该标注任务。本文描述了这一试点标注阶段的成果。通过该工作,我们获得了一种标注方法学,并发现了反映NLP-ML学术研究贡献的十个核心信息单元。基于这些信息单元开发的标注方案被称为NLPContributions。我们工作的总体目标是四方面的:1) 为学术贡献的语义结构化寻找一套主体-谓词-客体语句的系统模式,这些模式对NLP-ML研究文章或多或少具有通用适用性;2) 将发现的模式应用于创建更大的标注数据集,以训练研究贡献的机器阅读器;3) 将该数据集作为创建用户友好型SOTA综述的示范,摄入到开放研究知识图谱(ORKG)基础设施中;4) 将机器阅读器集成到ORKG中,以协助用户手动策展其各自文章的贡献。我们期望NLPContributions方法学能引发关于该主题更广泛的讨论,以推动其进一步完善与发展。我们根据NLPContributions方案对50篇NLP-ML学术文章的试点标注数据集已开放提供给研究界:https://doi.org/10.25835/0019761。
引用
@article{arxiv.2006.12870,
title = {NLPContributions: An Annotation Scheme for Machine Reading of Scholarly Contributions in Natural Language Processing Literature},
author = {Jennifer D'Souza and Sören Auer},
journal= {arXiv preprint arXiv:2006.12870},
year = {2020}
}
备注
In Proceedings of the 1st Workshop on Extraction and Evaluation of Knowledge Entities from Scientific Documents (EEKE 2020) co-located with the ACM/IEEE Joint Conference on Digital Libraries in 2020 (JCDL 2020), Virtual Event, China, August 1. http://ceur-ws.org/Vol-2658/