中文

文本文档中的阿尔巴尼亚语识别

信息检索 2019-01-15 v1 计算与语言

摘要

在这项工作中,我们研究了标准和最先进的语言识别方法在书面文本文档中识别阿尔巴尼亚语的准确性。为此构建了一个由阿尔巴尼亚语新闻文章组成的数据集。我们注意到,当测试文档缺少阿尔巴尼亚字母“Ë”和“Ç”时,准确性显著下降,并创建了一个自定义训练语料库,通过达到超过99%的准确率解决了该问题。基于我们的实验,对阿尔巴尼亚语性能最佳的语言识别方法使用朴素贝叶斯分类器和基于 n-gram 的分类特征。

关键词

引用

@article{arxiv.1901.04216,
  title  = {Albanian Language Identification in Text Documents},
  author = {Klesti Hoxha and Artur Baxhaku},
  journal= {arXiv preprint arXiv:1901.04216},
  year   = {2019}
}