神经阿拉伯语问答
计算与语言
2019-06-14 v1 机器学习
摘要
本文利用 Wikipedia 作为知识源,解决开放域事实型阿拉伯语问答(QA)问题。这将任何问题的答案限制为 Wikipedia 中的一段文本。阿拉伯语开放域 QA 面临三个挑战:阿拉伯语标注 QA 数据集、大规模高效信息检索以及机器阅读理解。为应对阿拉伯语 QA 数据集的缺乏,我们提出了阿拉伯语阅读理解数据集(ARCD),其由众包工作者在 Wikipedia 文章上提出的 1,395 个问题,以及斯坦福问答数据集的机器翻译版本(Arabic-SQuAD)组成。我们的阿拉伯语开放域问答系统(SOQAL)基于两个组件:(1) 使用分层 TF-IDF 方法的文档检索器;(2) 使用预训练双向 transformer BERT 的神经阅读理解模型。我们在 ARCD 上的实验表明了方法的有效性:基于 BERT 的阅读器取得了 61.3 的 F1 分数,我们的开放域系统 SOQAL 取得了 27.6 的 F1 分数。
引用
@article{arxiv.1906.05394,
title = {Neural Arabic Question Answering},
author = {Hussein Mozannar and Karl El Hajal and Elie Maamary and Hazem Hajj},
journal= {arXiv preprint arXiv:1906.05394},
year = {2019}
}
备注
WANLP 2019