中文

面向资源匮乏语言的短文本语言识别

计算与语言 2019-11-25 v2

摘要

本文提出了一种分层朴素贝叶斯与基于词典的分类器,用于资源匮乏语言的有用短文本语言识别(LID)。该算法在 11 种南非官方语言的短文本上进行了评估,其中部分语言为相似语言。该算法与近期方法进行了比较,使用了以往南非语言工作的测试集以及判别相似语言(DSL)共享任务的数据集。文中还讨论了在评估与比较 LID 方法中剩余的研究机会与紧迫问题。

关键词

引用

@article{arxiv.1911.07555,
  title  = {Short Text Language Identification for Under Resourced Languages},
  author = {Bernardt Duvenhage},
  journal= {arXiv preprint arXiv:1911.07555},
  year   = {2019}
}

备注

Presented at NeurIPS 2019 Workshop on Machine Learning for the Developing World