中文

从英语到语码转换:利用强形态学线索的迁移学习

计算与语言 2020-05-05 v3

摘要

语言语码转换(CS)在自然语言处理中仍是一个研究不足的现象。NLP社区主要关注单语和多语场景,但对CS本身关注甚少。部分原因在于缺乏资源和标注数据,尽管其在社交媒体平台上的出现日益增多。在本文中,我们旨在将单语模型适应于各种任务中的语码转换文本。具体来说,我们利用语言识别任务,将预训练的ELMo模型中的英语知识迁移到不同的语码转换语言对(即尼泊尔语-英语、西班牙语-英语和印地语-英语)。我们的方法CS-ELMo是ELMo的扩展,在其字符卷积内部引入了一个简单而有效的位置感知注意力机制。我们通过超越多语言BERT和同源的CS无感知ELMo模型,并在CS任务(如命名实体识别和词性标注)中建立了新的最优水平,展示了这一迁移学习步骤的有效性。我们的技术可以扩展到更多与英语配对的语码转换语言,为CS社区提供更多资源。

关键词

引用

@article{arxiv.1909.05158,
  title  = {From English to Code-Switching: Transfer Learning with Strong Morphological Clues},
  author = {Gustavo Aguilar and Thamar Solorio},
  journal= {arXiv preprint arXiv:1909.05158},
  year   = {2020}
}

备注

Accepted to ACL 2020