中文

从 RAG 到 Agentic RAG:面向可靠伊斯兰问答

计算与语言 2026-01-13 v1 人工智能

摘要

大型语言模型正在被用于伊斯兰问答领域,然而标准的多选题/机器阅读 comprehension 评估无法捕捉关键现实场景中的失效模式,尤其是自由形式的幻觉以及模型在证据缺失时是否恰当地选择不回答。为此,我们引入 ISLAMICFAITHQA,一个包含 3810 项双语(阿拉伯语/英文)生成式基准测试,包含原子化单金标准答案,能够直接测量幻觉与不回答行为。我们此外开发了一个端到端的伊斯兰建模套件,包括 (i) 25K 条阿拉伯语文本 grounding SFT 推理对,(ii) 5K 条双语偏好样本用于奖励引导的对齐,以及 (iii) 一个约6k 条原子化经文(ayat)的诗歌级别 Qur'an 检索语料库。基于这些资源,我们构建了一个 agentic Quran grounding 框架(agentic RAG),使用结构化工具调用进行迭代证据搜寻与答案修订。跨阿拉伯语中心模型和多语言模型的实验表明,检索可提升正确性,而 agentic RAG 在标准 RAG 之上取得最大提升,实现了最先进的性能和更强的阿拉伯-英文鲁棒性,即便在小模型(如 Qwen3 4B)上亦可实现。我们将公开实验资源和数据集供社区使用。

关键词

引用

@article{arxiv.2601.07528,
  title  = {From RAG to Agentic RAG for Faithful Islamic Question Answering},
  author = {Gagan Bhatia and Hamdy Mubarak and Mustafa Jarrar and George Mikros and Fadi Zaraket and Mahmoud Alhirthani and Mutaz Al-Khatib and Logan Cochrane and Kareem Darwish and Rashid Yahiaoui and Firoj Alam},
  journal= {arXiv preprint arXiv:2601.07528},
  year   = {2026}
}