中文

用于高效处理语码转换命名实体识别中未登录词的双语字符表示

计算与语言 2019-06-11 v2

摘要

我们提出了一种基于LSTM的层次化架构模型,用于语码转换Twitter数据的命名实体识别。我们的模型使用双语字符表示与迁移学习来处理未登录词。为减轻数据噪声,我们提出使用词元替换与归一化。在第3届计算语言语码转换方法研讨会共享任务中,我们针对英西语言对取得了第二名,调和平均F1值为62.76%,且未使用任何地名词典与基于知识的信息。

关键词

引用

@article{arxiv.1805.12061,
  title  = {Bilingual Character Representation for Efficiently Addressing Out-of-Vocabulary Words in Code-Switching Named Entity Recognition},
  author = {Genta Indra Winata and Chien-Sheng Wu and Andrea Madotto and Pascale Fung},
  journal= {arXiv preprint arXiv:1805.12061},
  year   = {2019}
}

备注

Accepted in "3rd Workshop in Computational Approaches in Linguistic Code-switching", ACL 2018