中文

面向南非诸语言的改进型文本语言识别

计算与语言 2017-11-02 v1

摘要

虚拟助手与文本聊天机器人近来日益普及。鉴于基于文本的聊天交互的短消息特性,这些机器人的语言识别系统可能仅有15或20个字符用以作出预测。然而,准确的文本语言识别十分重要,尤其在许多多语言自然语言处理流程的早期阶段。本文研究使用朴素贝叶斯分类器准确预测文本所属语族,并结合基于词典的分类器区分文本所写的具体南非语言。该方法使语言检测错误降低31%。本着可重复研究的精神,训练与测试数据集以及代码已发布于github。期望其有助于创建南非语言的文本语言识别共享任务。

关键词

引用

@article{arxiv.1711.00247,
  title  = {Improved Text Language Identification for the South African Languages},
  author = {Bernardt Duvenhage and Mfundo Ntini and Phala Ramonyai},
  journal= {arXiv preprint arXiv:1711.00247},
  year   = {2017}
}

备注

Accepted to appear in the proceedings of The 28th Annual Symposium of the Pattern Recognition Association of South Africa, 2017