中文

从网络构建阿拉伯语问题-文本对语料库的初步研究:AQA-Webcorp

计算与语言 2017-09-28 v1 信息检索

摘要

随着电子媒体的发展和网络上阿拉伯语数据的异构性,为自然语言处理的某些应用(包括机器翻译、信息检索、问答)构建干净语料库的想法变得越来越迫切。在本文中,我们寻求创建并开发我们自己的问题-文本对语料库。这一构建随后将为我们的实验步骤提供更好的基础。因此,我们尝试通过一种针对阿拉伯语的方法来对此构建进行建模,只要它从网络上检索到的文本可能被证明是我们事实性问题的答案。为此,我们不得不开发了一个 Java 脚本,该脚本可以从给定的查询中提取 HTML 页面列表。然后清理这些页面,以获得一个文本数据库和一个问题-文本对语料库。此外,我们给出了我们提出方法的初步结果。本文还介绍了构建阿拉伯语语料库的一些研究。

关键词

引用

@article{arxiv.1709.09404,
  title  = {A Preliminary Study for Building an Arabic Corpus of Pair Questions-Texts from the Web: AQA-Webcorp},
  author = {Wided Bakari and Patrice Bellot and Mahmoud Neji},
  journal= {arXiv preprint arXiv:1709.09404},
  year   = {2017}
}