中文

利用预训练词嵌入进行语码转换数据的词性标注

计算与语言 2019-10-08 v1

摘要

语言语码转换(CS)是指多语使用者在单次对话中于两种或更多语言/方言间交替的现象。鉴于当前最先进的单语NLP技术一次仅处理一种语言,处理句内CS数据尤其具有挑战性。本文针对语言语码转换(CS)情境下的词性标注(POS)问题。我们探索利用多种神经网络架构,以衡量不同预训练嵌入方法对CS数据POS标注的影响。我们考察了四种CS语言组合:西班牙语-英语、印地语-英语、现代标准阿拉伯语-埃及阿拉伯方言(MSA-EGY)和现代标准阿拉伯语-黎凡特阿拉伯方言(MSA-LEV)。结果表明,多语嵌入(如MSA-EGY和MSA-LEV)有助于密切关联的语言(EGY/LEV),但为疏远的语言(SPA/HIN)引入噪声。最后,我们证明所提模型在MSA-EGY语言组合上优于最先进的CS标注器。

关键词

引用

@article{arxiv.1905.13359,
  title  = {Leveraging Pretrained Word Embeddings for Part-of-Speech Tagging of Code Switching Data},
  author = {Fahad AlGhamdi and Mona Diab},
  journal= {arXiv preprint arXiv:1905.13359},
  year   = {2019}
}