中文

基于局部可加性的数据增强用于半监督命名实体识别

计算与语言 2020-10-06 v1

摘要

命名实体识别(NER)是深度语言理解的最初阶段之一,但当前 NER 模型严重依赖人工标注数据。本工作中,为减轻对标注数据的依赖,我们提出一种用于半监督 NER 的基于局部可加性的数据增强(LADA)方法,通过对彼此接近的序列进行插值来创建虚拟样本。我们的方法有两种变体:Intra-LADA 和 Inter-LADA,其中 Intra-LADA 在单句内对词元进行插值,Inter-LADA 采样不同句子进行插值。通过对采样训练数据进行线性相加,LADA 创建了无限量的标注数据,并改进了实体与上下文学习。我们进一步通过将未标注数据设计新颖一致性损失,将 LADA 扩展到半监督设定。在两个 NER 基准上的实验证明了我们的方法相对于若干强基线的有效性。我们已在 https://github.com/GT-SALT/LADA 公开发布代码。

关键词

引用

@article{arxiv.2010.01677,
  title  = {Local Additivity Based Data Augmentation for Semi-supervised NER},
  author = {Jiaao Chen and Zhenghui Wang and Ran Tian and Zichao Yang and Diyi Yang},
  journal= {arXiv preprint arXiv:2010.01677},
  year   = {2020}
}

备注

EMNLP 2020