面向信息检索的精确阿拉伯语词根词形还原器
计算与语言
2012-03-19 v1
摘要
尽管阿拉伯语具有稳健的句法、语义连贯性和较低的歧义性,但词形还原层面的分析和生成在阿拉伯语自然语言处理文献中尚未得到关注。在本研究中,我们提出了第一个适用于信息检索(IR)系统的非统计精确阿拉伯语词形还原算法。所提出的词形还原器利用多种阿拉伯语语言知识资源,生成精确的词形及其相关特征,以支持信息检索目的。作为词性标注器,实验结果表明,该算法达到了94.8%的最高准确率。对于首次见到的文档,准确率达到89.15%,而同一数据集上最新的斯坦福精确阿拉伯语模型准确率为76.7%。
引用
@article{arxiv.1203.3584,
title = {An Accurate Arabic Root-Based Lemmatizer for Information Retrieval Purposes},
author = {Tarek El-Shishtawy and Fatma El-Ghannam},
journal= {arXiv preprint arXiv:1203.3584},
year = {2012}
}
备注
9 pages