中文

TCE 在 Qur'an QA 2022 中的工作:基于 BERT 模型的集成后处理用于《古兰经》阿拉伯语问答

计算与语言 2022-06-06 v1 信息检索

摘要

近年来,我们见证了利用机器学习在自然语言理解各项任务上的巨大进展。问答是其中一项任务,被搜索引擎和社交媒体平台用于改善用户体验。阿拉伯语是《古兰经》的语言,是全球 18 亿人的圣典文本。由于其复杂的结构,阿拉伯语对自然语言处理(NLP)而言是一种具有挑战性的语言。在本文中,我们描述了在 OSACT5 Qur'an QA 2022 共享任务上的尝试,该任务是一项基于阿拉伯语《古兰经》的问答挑战。我们提出了一种基于阿拉伯语版 BERT 模型的集成学习模型。此外,我们进行了后处理以增强模型预测。我们的系统在官方测试集上取得了 56.6% 的 Partial Reciprocal Rank(pRR,部分倒数排名)分数。

关键词

引用

@article{arxiv.2206.01550,
  title  = {TCE at Qur'an QA 2022: Arabic Language Question Answering Over Holy Qur'an Using a Post-Processed Ensemble of BERT-based Models},
  author = {Mohammed ElKomy and Amany M. Sarhan},
  journal= {arXiv preprint arXiv:2206.01550},
  year   = {2022}
}

备注

OSACT5 workshop, Qur'an QA 2022 Shared Task participation by TCE