Shamela:一个大规模历史阿拉伯语语料库
计算与语言
2016-12-30 v1
摘要
阿拉伯语是一种广泛使用的语言,拥有跨越十四个世纪以上的丰富而悠久的历史。然而,现有的阿拉伯语语料库主要关注现代时期或缺乏足够的历时信息。我们构建了一个大规模的阿拉伯语历史语料库,包含来自不同时期的约 10 亿个词。我们清理了该语料库,使用形态学分析器对其进行处理,并通过检测平行段落和自动标注未标日期文本来增强该语料库。我们通过选定的案例研究展示了其效用,展示了其在数字人文中的应用。
引用
@article{arxiv.1612.08989,
title = {Shamela: A Large-Scale Historical Arabic Corpus},
author = {Yonatan Belinkov and Alexander Magidow and Maxim Romanov and Avi Shmidman and Moshe Koppel},
journal= {arXiv preprint arXiv:1612.08989},
year = {2016}
}
备注
Slightly expanded version of Coling LT4DH workshop paper