中文

一种快速、紧凑、精确的码混文本语言识别模型

计算与语言 2018-10-10 v1

摘要

我们处理细粒度多语言语言识别问题:为句子中每个词元提供语言代码,包括包含多种语言的码混文本。此类文本在网络文档、社交媒体和留言板中十分普遍。我们展示了一种带有简单全局约束解码器的前馈网络,能够准确且快速地标注 100 种语言和 100 种语言对的码混与单语文本。该模型在准确率和速度上均优于先前发表的多语言方法,在三个码混数据集上实现了 800 倍加速和 19.5% 的平均绝对提升。此外,它在单语语言识别上也优于多个基准系统。

关键词

引用

@article{arxiv.1810.04142,
  title  = {A Fast, Compact, Accurate Model for Language Identification of Codemixed Text},
  author = {Yuan Zhang and Jason Riesa and Daniel Gillick and Anton Bakalov and Jason Baldridge and David Weiss},
  journal= {arXiv preprint arXiv:1810.04142},
  year   = {2018}
}

备注

EMNLP 2018