结合对比与原型学习改进跨语言命名实体识别的自训练
计算与语言
2023-06-06 v2
摘要
在跨语言命名实体识别(NER)中,自训练常通过在伪标记的目标语言数据上训练来弥合语言鸿沟。然而,由于目标语言性能欠佳,伪标记往往含噪并限制整体表现。在本工作中,我们旨在将表示学习与伪标记精炼置于统一框架中,以改进跨语言 NER 的自训练。我们提出的方法 ContProto 主要包含两个组件:(1)对比自训练与(2)基于原型的伪标记。我们的对比自训练通过分离不同类别的簇来促进跨度分类,并通过在源语言与目标语言间产生紧密对齐的表示来增强跨语言可迁移性。同时,基于原型的伪标记有效提升了训练期间伪标记的准确性。我们在多个迁移对上评估 ContProto,实验结果显示我们的方法相较当前 state-of-the-art 方法带来了显著改进。
引用
@article{arxiv.2305.13628,
title = {Improving Self-training for Cross-lingual Named Entity Recognition with Contrastive and Prototype Learning},
author = {Ran Zhou and Xin Li and Lidong Bing and Erik Cambria and Chunyan Miao},
journal= {arXiv preprint arXiv:2305.13628},
year = {2023}
}
备注
Accepted by ACL2023