中文

USTC-NELSLIP 在 SemEval-2022 任务 11 中的工作:面向多语言复杂命名实体识别的地名词典自适应集成网络

计算与语言 2023-05-09 v2

摘要

本文描述了 USTC-NELSLIP 团队为 SemEval-2022 任务 11 多语言复杂命名实体识别(MultiCoNER)所开发的系统。我们提出了一种地名词典自适应集成网络(GAIN),以提升语言模型在识别复杂命名实体上的性能。该方法首先通过最小化地名词典网络与语言模型表示之间的 KL 散度,将前者表示适配到后者。适配后,这两个网络被集成用于后端有监督的命名实体识别(NER)训练。所提方法应用于多个基于 Transformer 的 SOTA NER 模型,并采用从 Wikidata 构建的地名词典,在这些模型上展现出良好的泛化能力。最终预测由这些训练模型的集成得出。实验结果和详细分析验证了所提方法的有效性。官方结果显示,我们的系统在三个赛道(中文、混合代码和孟加拉语)上排名第 1,在其余十个赛道上排名第 2。

关键词

引用

@article{arxiv.2203.03216,
  title  = {USTC-NELSLIP at SemEval-2022 Task 11: Gazetteer-Adapted Integration Network for Multilingual Complex Named Entity Recognition},
  author = {Beiduo Chen and Jun-Yu Ma and Jiajun Qi and Wu Guo and Zhen-Hua Ling and Quan Liu},
  journal= {arXiv preprint arXiv:2203.03216},
  year   = {2023}
}

备注

Winner system (USTC-NELSLIP) of SemEval 2022 MultiCoNER shared task on 3 tracks (Chinese, Bangla, Code-mixed)