面向语码转换数据的词汇归一化及其对词性标注的影响
计算与语言
2021-02-02 v2
摘要
词汇归一化,即将非规范数据翻译为标准语言,已被证明可提升社交媒体上许多自然语言处理任务的性能。然而,尽管语码转换(CS,即在一个话语中使用多种语言)在社交媒体中常见,这些归一化系统却常忽视之。本文提出三种专门设计用于处理语码转换数据的归一化模型,并在两种语言对上评估:印尼语-英语(Id-En)和土耳其语-德语(Tr-De)。对于后者,我们引入了新的归一化层及其对应的数据集语言 ID 与词性(POS)标签,并评估归一化对词性标注的下游影响。结果表明,我们针对 CS 定制的归一化模型优于 Id-En 的当前最优方法和 Tr-De 的单语模型,并且与未归一化输入相比,词性标注相对性能提升 5.4%。
引用
@article{arxiv.2006.01175,
title = {Lexical Normalization for Code-switched Data and its Effect on POS-tagging},
author = {Rob van der Goot and Özlem Çetinoğlu},
journal= {arXiv preprint arXiv:2006.01175},
year = {2021}
}