中文

GSAP-NER:面向机器学习模型与数据集的学术实体抽取新任务、语料库与基线

计算与语言 2023-11-17 v1

摘要

命名实体识别(NER)模型在包括信息抽取(IE)和文本理解在内的各种自然语言处理(NLP)任务中发挥着关键作用。在学术写作中,对机器学习模型和数据集的引用是各类计算机科学出版物的重要组成部分,需要准确的模型来进行识别。尽管 NER 取得了进展,现有的真实标注数据集并未将细粒度类型如 ML 模型和模型架构作为独立的实体类型,因此基线模型无法将其识别为此类实体。在本文中,我们发布了一个包含 100 篇人工标注全文科学出版物的语料库,以及一个以 ML 模型和数据集为核心的 10 类实体的首个基线模型。为了细致理解 ML 模型和数据集如何被提及和使用,我们的数据集还包含对非正式提及的标注,如“我们的基于 BERT 的模型”或“一个图像 CNN”。您可以在 https://data.gesis.org/gsap/gsap-ner 找到真实标注数据集和用于复现模型训练的代码。

关键词

引用

@article{arxiv.2311.09860,
  title  = {GSAP-NER: A Novel Task, Corpus, and Baseline for Scholarly Entity Extraction Focused on Machine Learning Models and Datasets},
  author = {Wolfgang Otto and Matthäus Zloch and Lu Gan and Saurav Karmakar and Stefan Dietze},
  journal= {arXiv preprint arXiv:2311.09860},
  year   = {2023}
}

备注

10 pages, 1 figure, Accepted at EMNLP2023-Findings