基于对抗学习利用众包标注的中文命名实体识别
计算与语言
2018-01-17 v1
摘要
为了快速获取新的标注数据,我们可以选择众包作为一种替代方式,以更低的成本和更短的时间完成。但作为交换,来自非专家的众包标注质量可能低于专家标注。本文提出一种针对中文命名实体识别(NER)的众包标注学习方法,以充分利用来自多个标注者的含噪序列标签。受对抗学习启发,我们的方法使用一个公共 Bi-LSTM 和一个私有 Bi-LSTM 来分别表示标注者通用和特定的信息。标注者通用信息是群体易于掌握的关于实体的常识。最后,我们基于 LSTM-CRF 模型构建了中文命名实体标注器。在实验中,我们为来自两个领域的中文 NER 任务创建了两个数据集。实验结果表明,我们的系统取得了优于强基线系统的分数。
引用
@article{arxiv.1801.05147,
title = {Adversarial Learning for Chinese NER from Crowd Annotations},
author = {YaoSheng Yang and Meishan Zhang and Wenliang Chen and Wei Zhang and Haofen Wang and Min Zhang},
journal= {arXiv preprint arXiv:1801.05147},
year = {2018}
}
备注
8 pages, AAAI-2018