中文

使用平行语料的跨语言命名实体识别:一种基于 XLM-RoBERTa 对齐的新方法

计算与语言 2021-01-28 v1

摘要

我们提出了一种利用平行语料进行跨语言命名实体识别(NER)零样本迁移的新方法。我们在 XLM-RoBERTa 之上构建了一个实体对齐模型,将平行数据英文部分上检测到的实体投影到目标语言句子,其准确率超越了所有先前的无监督模型。借助该对齐模型,我们可以获得目标语言中的伪标注 NER 数据集以训练任务特定模型。与使用翻译方法不同,该方法受益于目标语言原始语料中的自然流畅性与细微差别。我们还提出了一种类似于 focal loss 但以相反方向分配权重的改进损失函数,以进一步改进在含噪声伪标注数据集上的模型训练。我们在基准数据集上以 4 种目标语言评估了该方法,并与近期多数 SOTA 模型相比获得了有竞争力的 F1 分数。我们还额外讨论了平行语料规模与领域对最终迁移性能的影响。

关键词

引用

@article{arxiv.2101.11112,
  title  = {Cross-Lingual Named Entity Recognition Using Parallel Corpus: A New Approach Using XLM-RoBERTa Alignment},
  author = {Bing Li and Yujie He and Wenjin Xu},
  journal= {arXiv preprint arXiv:2101.11112},
  year   = {2021}
}

备注

9 pages, 4 figures