利用多语言资源实现阿拉伯语问答
计算与语言
2022-05-18 v1
摘要
本文的目标是根据给定的《古兰经》经文预测问题的答案。答案始终存在于经文中,因此模型的任务是预测答案的起始位置和结束位置。由于初始数据集规模较小,不利于训练,我们利用多语言BERT,通过使用阿拉伯语以外的其他语言可用数据来扩充训练数据。此外,我们爬取了一个特定于宗教话语领域的大型阿拉伯语语料库。我们的方法包含两个步骤:首先,训练一个BERT模型来预测经文中的一组候选答案;最后,使用另一个基于BERT的模型对第一个BERT模型生成的候选答案进行排序。
引用
@article{arxiv.2205.08024,
title = {Harnessing Multilingual Resources to Question Answering in Arabic},
author = {Khalid Alnajjar and Mika Hämäläinen},
journal= {arXiv preprint arXiv:2205.08024},
year = {2022}
}