中文

利用免费开放数据源构建大规模命名实体识别语料库

计算与语言 2019-08-19 v1 人工智能

摘要

随着机器学习尤其是深度学习等技术的近期进展,一旦有足大的数据集用于训练,许多任务都能被成功解决。然而,人工标注的数据集往往生产成本高昂,尤其是当标签粒度较细时,命名实体识别(NER)便是如此,该任务在词级别上操作标签。在本文中,我们提出一种方法,通过利用来自 DBpedia 和 Wikipedia 的链接与结构化数据,从公共数据源自动生成 NER 标注数据集。由于这些数据源规模庞大,所得数据集——SESAME(可在 https://sesame-pt.github.io 获取)——由数百万条标注句子组成。我们详述了生成该数据集的方法,报告了相关统计信息,并使用神经网络设计了一个基线,表明我们的数据集有助于构建更好的 NER 预测器。

关键词

引用

@article{arxiv.1908.05758,
  title  = {Building a Massive Corpus for Named Entity Recognition using Free Open Data Sources},
  author = {Daniel Specht Menezes and Pedro Savarese and Ruy Luiz Milidiú},
  journal= {arXiv preprint arXiv:1908.05758},
  year   = {2019}
}