面向南非诸语言的改进型文本语言识别
计算与语言
2017-11-02 v1
摘要
虚拟助手与文本聊天机器人近来日益普及。鉴于基于文本的聊天交互的短消息特性,这些机器人的语言识别系统可能仅有15或20个字符用以作出预测。然而,准确的文本语言识别十分重要,尤其在许多多语言自然语言处理流程的早期阶段。本文研究使用朴素贝叶斯分类器准确预测文本所属语族,并结合基于词典的分类器区分文本所写的具体南非语言。该方法使语言检测错误降低31%。本着可重复研究的精神,训练与测试数据集以及代码已发布于github。期望其有助于创建南非语言的文本语言识别共享任务。
引用
@article{arxiv.1711.00247,
title = {Improved Text Language Identification for the South African Languages},
author = {Bernardt Duvenhage and Mfundo Ntini and Phala Ramonyai},
journal= {arXiv preprint arXiv:1711.00247},
year = {2017}
}
备注
Accepted to appear in the proceedings of The 28th Annual Symposium of the Pattern Recognition Association of South Africa, 2017