用于高效处理语码转换命名实体识别中未登录词的双语字符表示
计算与语言
2019-06-11 v2
摘要
我们提出了一种基于LSTM的层次化架构模型,用于语码转换Twitter数据的命名实体识别。我们的模型使用双语字符表示与迁移学习来处理未登录词。为减轻数据噪声,我们提出使用词元替换与归一化。在第3届计算语言语码转换方法研讨会共享任务中,我们针对英西语言对取得了第二名,调和平均F1值为62.76%,且未使用任何地名词典与基于知识的信息。
引用
@article{arxiv.1805.12061,
title = {Bilingual Character Representation for Efficiently Addressing Out-of-Vocabulary Words in Code-Switching Named Entity Recognition},
author = {Genta Indra Winata and Chien-Sheng Wu and Andrea Madotto and Pascale Fung},
journal= {arXiv preprint arXiv:1805.12061},
year = {2019}
}
备注
Accepted in "3rd Workshop in Computational Approaches in Linguistic Code-switching", ACL 2018