利用免费开放数据源构建大规模命名实体识别语料库
计算与语言
2019-08-19 v1 人工智能
摘要
随着机器学习尤其是深度学习等技术的近期进展,一旦有足大的数据集用于训练,许多任务都能被成功解决。然而,人工标注的数据集往往生产成本高昂,尤其是当标签粒度较细时,命名实体识别(NER)便是如此,该任务在词级别上操作标签。在本文中,我们提出一种方法,通过利用来自 DBpedia 和 Wikipedia 的链接与结构化数据,从公共数据源自动生成 NER 标注数据集。由于这些数据源规模庞大,所得数据集——SESAME(可在 https://sesame-pt.github.io 获取)——由数百万条标注句子组成。我们详述了生成该数据集的方法,报告了相关统计信息,并使用神经网络设计了一个基线,表明我们的数据集有助于构建更好的 NER 预测器。
引用
@article{arxiv.1908.05758,
title = {Building a Massive Corpus for Named Entity Recognition using Free Open Data Sources},
author = {Daniel Specht Menezes and Pedro Savarese and Ruy Luiz Milidiú},
journal= {arXiv preprint arXiv:1908.05758},
year = {2019}
}