面向印地语与摩揭陀语的自动语言识别系统
计算与语言
2018-04-17 v1
摘要
语言识别已成为所有类型的自动化文本处理系统的先决条件。在本文中,我们提出了一种针对两种密切相关的印度-雅利安语支语言:印地语和摩揭陀语的基于规则的语言识别工具。该系统目前达到了约 86.34% 的准确率。我们希望在未来对此进行改进。语言的自动识别将对网络爬虫的输出准确率具有重要意义。
引用
@article{arxiv.1804.05095,
title = {Automatic Language Identification System for Hindi and Magahi},
author = {Priya Rani and Atul Kr. Ojha and Girish Nath Jha},
journal= {arXiv preprint arXiv:1804.05095},
year = {2018}
}
备注
WILDRE-4 2018 Workshop Proceedings under the LREC 2018