使用平行语料的跨语言命名实体识别:一种基于 XLM-RoBERTa 对齐的新方法
计算与语言
2021-01-28 v1
摘要
我们提出了一种利用平行语料进行跨语言命名实体识别(NER)零样本迁移的新方法。我们在 XLM-RoBERTa 之上构建了一个实体对齐模型,将平行数据英文部分上检测到的实体投影到目标语言句子,其准确率超越了所有先前的无监督模型。借助该对齐模型,我们可以获得目标语言中的伪标注 NER 数据集以训练任务特定模型。与使用翻译方法不同,该方法受益于目标语言原始语料中的自然流畅性与细微差别。我们还提出了一种类似于 focal loss 但以相反方向分配权重的改进损失函数,以进一步改进在含噪声伪标注数据集上的模型训练。我们在基准数据集上以 4 种目标语言评估了该方法,并与近期多数 SOTA 模型相比获得了有竞争力的 F1 分数。我们还额外讨论了平行语料规模与领域对最终迁移性能的影响。
引用
@article{arxiv.2101.11112,
title = {Cross-Lingual Named Entity Recognition Using Parallel Corpus: A New Approach Using XLM-RoBERTa Alignment},
author = {Bing Li and Yujie He and Wenjin Xu},
journal= {arXiv preprint arXiv:2101.11112},
year = {2021}
}
备注
9 pages, 4 figures