中文

利用扩展的问答数据集和微调语言模型优化《古兰经》段落检索

计算与语言 2024-12-17 v1 信息检索

摘要

理解《古兰经》的深层含义并弥合现代标准阿拉伯语与古典阿拉伯语之间的语言差距,对于改进《古兰经》问答系统至关重要。Qur'an QA 2023共享任务数据集问题数量有限且模型检索能力弱。为应对这一挑战,本工作更新了原始数据集并提高了模型准确性。原始数据集包含251个问题,经过审查并扩展至629个问题,通过问题多样化和重新表述,最终得到1895个问题,分为单答案、多答案和无答案类型。大量实验微调了Transformer模型,包括AraBERT、RoBERTa、CAMeLBERT、AraELECTRA和BERT。最佳模型AraBERT-base在MAP@10上达到0.36,MRR为0.59,相比基线分数(MAP@10: 0.22, MRR: 0.37)分别提高了63%和59%。此外,数据集扩展导致处理“无答案”案例的改进,所提方法对此类实例的成功率达到75%,而基线为25%。这些结果证明了数据集改进和模型架构优化在提高《古兰经》问答系统性能方面的效果,具有更高的准确率、召回率和精确率。

关键词

引用

@article{arxiv.2412.11431,
  title  = {Optimized Quran Passage Retrieval Using an Expanded QA Dataset and Fine-Tuned Language Models},
  author = {Mohamed Basem and Islam Oshallah and Baraa Hikal and Ali Hamdi and Ammar Mohamed},
  journal= {arXiv preprint arXiv:2412.11431},
  year   = {2024}
}