中文

关联度量及其组合在阿拉伯语多词术语提取中的研究

计算与语言 2014-09-11 v1

摘要

自动多词术语(Multi-Word Term, MWT)提取对于信息检索、问答系统和文本分类等诸多应用至关重要。尽管英语和其他欧洲语言的多词术语提取已采用多种方法,但针对阿拉伯语的研究却寥寥无几。本文提出了一种新颖的混合方法,结合语言学和统计学途径进行阿拉伯语多词术语提取。我们方法的主要贡献在于,在统计过滤步骤中,关联度量同时考虑了上下文信息以及术语度(termhood)和单元度(unithood)。此外,我们的技术在语言过滤步骤中考虑了多词术语变异的问题。我们通过将所提出的统计度量(NLC-value)与一些现有竞争者进行比较,利用阿拉伯语环境语料库评估了其性能。实验结果表明,就二元组和三词组的精确率而言,我们的 NLC-value 度量优于其他度量。

关键词

引用

@article{arxiv.1409.3005,
  title  = {A Study of Association Measures and their Combination for Arabic MWT Extraction},
  author = {Abdelkader El Mahdaouy and Saïd EL Alaoui Ouatik and Eric Gaussier},
  journal= {arXiv preprint arXiv:1409.3005},
  year   = {2014}
}

备注

This paper have been presented and published in 10th International Conference on Terminology and Artificial Intelligence Proceedings