中文

基于目标语言无标注数据的师生学习实现单源/多源跨语言命名实体识别

计算与语言 2020-07-16 v2

摘要

为了更好地解决标注数据很少或没有标注数据的语言上的命名实体识别(NER)问题,跨语言 NER 必须有效利用从具有丰富标注数据的源语言中学到的知识。以往的跨语言 NER 工作大多基于成对文本的标签投影或直接模型迁移。然而,这类方法要么在源语言标注数据不可用时无法适用,要么未能利用目标语言中无标注数据所包含的信息。在本文中,我们提出一种师生学习方法来解决这些局限,其中源语言中的 NER 模型被用作教师,在目标语言的无标注数据上训练学生模型。所提方法适用于单源和多源跨语言 NER。对于后者,我们进一步提出一种相似度度量方法,以更好地权衡来自不同教师模型的监督。在基准数据集上对 3 种目标语言的大量实验充分表明,我们的方法在单源和多源跨语言 NER 上都优于现有的 SOTA 方法。

关键词

引用

@article{arxiv.2004.12440,
  title  = {Single-/Multi-Source Cross-Lingual NER via Teacher-Student Learning on Unlabeled Data in Target Language},
  author = {Qianhui Wu and Zijia Lin and Börje F. Karlsson and Jian-Guang Lou and Biqing Huang},
  journal= {arXiv preprint arXiv:2004.12440},
  year   = {2020}
}

备注

This paper is accepted by ACL2020. Code is available at https://github.com/microsoft/vert-papers/tree/master/papers/SingleMulti-TS