利用预训练词嵌入进行语码转换数据的词性标注
计算与语言
2019-10-08 v1
摘要
语言语码转换(CS)是指多语使用者在单次对话中于两种或更多语言/方言间交替的现象。鉴于当前最先进的单语NLP技术一次仅处理一种语言,处理句内CS数据尤其具有挑战性。本文针对语言语码转换(CS)情境下的词性标注(POS)问题。我们探索利用多种神经网络架构,以衡量不同预训练嵌入方法对CS数据POS标注的影响。我们考察了四种CS语言组合:西班牙语-英语、印地语-英语、现代标准阿拉伯语-埃及阿拉伯方言(MSA-EGY)和现代标准阿拉伯语-黎凡特阿拉伯方言(MSA-LEV)。结果表明,多语嵌入(如MSA-EGY和MSA-LEV)有助于密切关联的语言(EGY/LEV),但为疏远的语言(SPA/HIN)引入噪声。最后,我们证明所提模型在MSA-EGY语言组合上优于最先进的CS标注器。
引用
@article{arxiv.1905.13359,
title = {Leveraging Pretrained Word Embeddings for Part-of-Speech Tagging of Code Switching Data},
author = {Fahad AlGhamdi and Mona Diab},
journal= {arXiv preprint arXiv:1905.13359},
year = {2019}
}