基于集成检索与指令微调答案抽取的两阶段古兰经问答
计算与语言
2025-09-05 v2 信息检索
摘要
古兰经问答因古典阿拉伯语的语言复杂性和宗教文本的语义丰富性而面临独特挑战。本文提出一种新颖的两阶段框架,同时处理段落检索与答案抽取。在段落检索阶段,我们集成微调后的阿拉伯语语言模型,以实现更优的排序性能。在答案抽取阶段,我们采用指令微调的大语言模型并结合少样本提示,以克服在小数据集上微调的局限性。我们的方法在 Quran QA 2023 共享任务上取得了最先进的结果,检索的 MAP@10 为 0.3128、MRR@10 为 0.5763,抽取的 pAP@10 为 0.669,大幅优于先前方法。这些结果表明,将模型集成与指令微调语言模型相结合,能有效应对低资源领域问答的挑战。
引用
@article{arxiv.2508.06971,
title = {Two-Stage Quranic QA via Ensemble Retrieval and Instruction-Tuned Answer Extraction},
author = {Mohamed Basem and Islam Oshallah and Ali Hamdi and Khaled Shaban and Hozaifa Kassab},
journal= {arXiv preprint arXiv:2508.06971},
year = {2025}
}
备注
8 pages , 4 figures , Accepted in Aiccsa 2025 , https://conferences.sigappfr.org/aiccsa2025/