中文

基于CNN-LSTM-CRF与分词联合训练的神经中文命名实体识别

计算与语言 2019-05-07 v1 机器学习 机器学习

摘要

中文命名实体识别(CNER)是中文自然语言处理领域的一项重要任务。然而,由于中文实体名高度依赖上下文,CNER极具挑战性。此外,中文文本缺乏词分隔符,难以确定实体边界。再者,许多领域的CNER训练数据通常不足,且标注足够训练数据成本高、耗时久。本文提出一种用于CNER的神经方法。首先,我们引入CNN-LSTM-CRF神经架构以捕获CNER的局部与长距离上下文。其次,我们提出统一框架联合训练CNER与分词模型,以增强CNER模型识别实体边界的能力。第三,我们引入一种从已有标注数据自动生成伪标注样本的方法,可丰富训练数据。在两个基准数据集上的实验表明,我们的方法能有效提升中文命名实体识别性能,尤其在训练数据不足时。

关键词

引用

@article{arxiv.1905.01964,
  title  = {Neural Chinese Named Entity Recognition via CNN-LSTM-CRF and Joint Training with Word Segmentation},
  author = {Fangzhao Wu and Junxin Liu and Chuhan Wu and Yongfeng Huang and Xing Xie},
  journal= {arXiv preprint arXiv:1905.01964},
  year   = {2019}
}

备注

7 pages, 3 figures, accepted by the 2019 World Wide Web Conference (WWW'19)