中文

利用全局-局部去噪框架改进跨语言命名实体识别的伪标签

计算与语言 2024-06-04 v1 人工智能

摘要

跨语言命名实体识别(NER)旨在仅利用有标签的源语言数据和无标签的目标语言数据,为目标语言训练NER模型。先前的方法要么对翻译后的源语言数据进行标签投影,要么使用源模型为目标语言数据分配伪标签,并在这些伪标签数据上训练目标模型以泛化到目标语言。然而,这些自动标注过程不可避免地引入噪声标签,从而导致性能下降。在本文中,我们提出了一种用于跨语言NER的全局-局部去噪框架(GLoDe)。具体而言,GLoDe通过利用语义空间中的全局和局部分布信息,引入渐进式去噪策略来纠正错误的伪标签。精炼后的伪标签目标语言数据显著提高了模型的泛化能力。此外,先前的方法仅考虑利用语言无关特征改进模型,但我们认为目标语言特定特征也很重要,不应被忽视。为此,我们采用一个简单的辅助任务来实现这一目标。在包含六种目标语言的两个基准数据集上的实验结果表明,我们提出的GLoDe显著优于当前最先进的方法。

关键词

引用

@article{arxiv.2406.01213,
  title  = {Improving Pseudo Labels with Global-Local Denoising Framework for Cross-lingual Named Entity Recognition},
  author = {Zhuojun Ding and Wei Wei and Xiaoye Qu and Dangyang Chen},
  journal= {arXiv preprint arXiv:2406.01213},
  year   = {2024}
}

备注

Accepted by IJCAI 2024