中文

15亿词阿拉伯语语料库

计算与语言 2016-11-15 v1 数字图书馆 信息检索

摘要

本研究试图构建一个当代阿拉伯语语言语料库。所生成的语料库是一个文本语料库,包含超过五百万篇报纸文章。其总共包含超过十五亿词,其中约有三百万人独特词。数据收集自八个阿拉伯国家十大主要新闻来源的报纸文章,时间跨度为十四年。该语料库采用两种编码类型,即UTF-8和Windows CP-1256。同时它用两种标记语言标注,即SGML和XML。

关键词

引用

@article{arxiv.1611.04033,
  title  = {1.5 billion words Arabic Corpus},
  author = {Ibrahim Abu El-khair},
  journal= {arXiv preprint arXiv:1611.04033},
  year   = {2016}
}