一种快速、紧凑、精确的码混文本语言识别模型
计算与语言
2018-10-10 v1
摘要
我们处理细粒度多语言语言识别问题:为句子中每个词元提供语言代码,包括包含多种语言的码混文本。此类文本在网络文档、社交媒体和留言板中十分普遍。我们展示了一种带有简单全局约束解码器的前馈网络,能够准确且快速地标注 100 种语言和 100 种语言对的码混与单语文本。该模型在准确率和速度上均优于先前发表的多语言方法,在三个码混数据集上实现了 800 倍加速和 19.5% 的平均绝对提升。此外,它在单语语言识别上也优于多个基准系统。
引用
@article{arxiv.1810.04142,
title = {A Fast, Compact, Accurate Model for Language Identification of Codemixed Text},
author = {Yuan Zhang and Jason Riesa and Daniel Gillick and Anton Bakalov and Jason Baldridge and David Weiss},
journal= {arXiv preprint arXiv:1810.04142},
year = {2018}
}
备注
EMNLP 2018