中文

为Twitter上的挪威语变体标注词性

计算与语言 2022-10-13 v1

摘要

挪威语Twitter数据给自然语言处理(NLP)任务带来了有趣的挑战。这些文本对于在两种挪威语书面标准形式(Bokmål和Nynorsk)之一的标准化文本上训练的模型而言十分困难,因为它们既包含社交媒体文本的典型变异,也包含大量的方言多样性。在本文中,我们提出了一个标注了词性(POS)标签的新型挪威语Twitter数据集。我们表明,在Universal Dependency(UD)数据上训练的模型在该数据集上评估时表现更差,且基于Bokmål训练的模型通常优于基于Nynorsk训练的模型。我们还发现,对于某些模型,方言推文的性能与书面标准相当。最后,我们对模型在该数据上常犯的错误进行了详细分析。

关键词

引用

@article{arxiv.2210.06150,
  title  = {Annotating Norwegian Language Varieties on Twitter for Part-of-Speech},
  author = {Petter Mæhlum and Andre Kåsen and Samia Touileb and Jeremy Barnes},
  journal= {arXiv preprint arXiv:2210.06150},
  year   = {2022}
}

备注

Accepted at the Ninth Workshop on NLP for Similar Languages, Varieties and Dialects (Vardial2022). Collocated with COLING2022