面向Web自动段落抽取的阿拉伯语问题逻辑表示
信息检索
2018-05-24 v1 社会与信息网络
摘要
随着网络上阿拉伯语电子数据的快速增长,信息抽取实际上是问答的主要挑战之一,主要用于构建文档语料库。事实上,构建语料库是当前自然语言处理(NLP)会议若干主要主题(如信息检索(IR)、问答(QA)、自动摘要(AS)等)中所涉及的研究课题。一般而言,问答系统提供若干段落来回答用户问题。为使这些段落真正具有信息量,系统需要访问底层知识库;这就需要构建语料库。我们研究的目标是构建一个阿拉伯语问答系统。此外,分析问题必须是第一步。接下来,必须从网络中检索可用作恰当答案的段落。本文提出一种分析阿拉伯语问题并检索段落答案的方法。对于问题分析,处理了五类事实性问题。此外,我们的目的是尝试从每个问题的陈述形式生成逻辑表示。若干关于问答中逻辑方法的研究已在阿拉伯语以外的语言中得到讨论。该表示很有前景,因为它有助于我们后续选择有依据的答案。被正确分析并转化为逻辑形式的问题准确率达64%。随后,自动生成的文本段落结果在准确率上达到87%,在c@1上达到98%。
引用
@article{arxiv.1805.09120,
title = {A logical representation of Arabic questions toward automatic passage extraction from the Web},
author = {Patrice Bellot and Wided Bakari and Mahmoud Neji},
journal= {arXiv preprint arXiv:1805.09120},
year = {2018}
}