CROP:基于多语言标注序列翻译的零样本跨语言命名实体识别
计算与语言
2022-10-14 v1
摘要
命名实体识别(NER)受限于标注训练数据的稀缺,尤其是对于无标注数据的低资源语言。跨语言 NER 已被提出,通过对齐的跨语言表示或机器翻译结果将知识从高资源语言迁移到低资源语言以缓解此问题。然而,跨语言 NER 方法的性能严重受限于翻译或标签投影的不佳质量。为解决这些问题,我们提出一种跨语言实体投影框架(CROP),借助多语言标注序列翻译模型实现零样本跨语言 NER。具体而言,首先将目标序列翻译为源语言,然后由源 NER 模型打标。我们进一步采用标注序列翻译模型将已标注序列投影回目标语言并标注目标原始句子。最终,整个流程通过自训练方式集成至端到端模型。在两个基准上的实验结果表明,我们的方法以 +3~7 F1 分数的大幅优势显著超越先前的强基线,并达到了最先进(state-of-the-art)性能。
引用
@article{arxiv.2210.07022,
title = {CROP: Zero-shot Cross-lingual Named Entity Recognition with Multilingual Labeled Sequence Translation},
author = {Jian Yang and Shaohan Huang and Shuming Ma and Yuwei Yin and Li Dong and Dongdong Zhang and Hongcheng Guo and Zhoujun Li and Furu Wei},
journal= {arXiv preprint arXiv:2210.07022},
year = {2022}
}
备注
10 pages