中文

ConNER:面向跨语言命名实体识别的一致性训练

计算与语言 2022-11-18 v1

摘要

跨语言命名实体识别(NER)受目标语言数据稀缺的困扰,尤其在零样本设定下。现有的翻译训练或知识蒸馏方法试图弥合语言鸿沟,但常引入较高水平的噪声。为解决该问题,一致性训练方法正则化模型以对数据或隐状态的扰动保持鲁棒。然而,此类方法可能违背一致性假设,或主要关注粗粒度一致性。我们提出 ConNER 作为一种新颖的跨语言 NER 一致性训练框架,其包含:(1)基于翻译的未标注目标语言数据一致性训练,以及(2)基于 dropout 的标注源语言数据一致性训练。ConNER 有效利用未标注目标语言数据并缓解在源语言上的过拟合,从而增强跨语言适应性。实验结果表明,我们的 ConNER 相较多种基线方法取得了一致的提升。

关键词

引用

@article{arxiv.2211.09394,
  title  = {ConNER: Consistency Training for Cross-lingual Named Entity Recognition},
  author = {Ran Zhou and Xin Li and Lidong Bing and Erik Cambria and Luo Si and Chunyan Miao},
  journal= {arXiv preprint arXiv:2211.09394},
  year   = {2022}
}

备注

Accepted by EMNLP 2022