Sebastian, Basti, Wastl?!巴伐利亚方言数据中的命名实体识别
计算与语言
2024-03-20 v1
摘要
命名实体识别(NER)是从文本中提取关键信息的基础任务,但方言的标注资源十分匮乏。本文介绍了首个德语方言 NER 数据集 BarNER,包含 161K 个标注 token,数据来源于巴伐利亚维基百科文章(bar-wiki)和推文(bar-tweet),标注体系改编自德语 CoNLL 2006 和 GermEval。巴伐利亚方言在词汇分布、句法结构和实体信息方面均与标准德语不同。我们在两个巴伐利亚语料库和三个德语语料库上进行了领域内、跨领域、顺序和联合实验,并给出了首批全面的巴伐利亚语 NER 结果。引入更大规模德语 NER(子)数据集的知识显著提升了 bar-wiki 上的表现,并对 bar-tweet 有适度改进。反之,先在巴伐利亚语上训练对经典的德语 CoNLL 2006 语料库略有助益。此外,借助巴伐利亚推文上的标准方言标签,我们评估了五项 NER 任务与两项巴伐利亚-德语方言识别任务之间的多任务学习,并在 bar-wiki 上取得了 NER SOTA。本文论证了低资源 BarNER 语料库的必要性,以及方言、体裁与话题多样性对提升模型性能的重要意义。
引用
@article{arxiv.2403.12749,
title = {Sebastian, Basti, Wastl?! Recognizing Named Entities in Bavarian Dialectal Data},
author = {Siyao Peng and Zihang Sun and Huangyan Shan and Marie Kolm and Verena Blaschke and Ekaterina Artemova and Barbara Plank},
journal= {arXiv preprint arXiv:2403.12749},
year = {2024}
}
备注
LREC-COLING 2024