中文

探索阿拉伯经文研究中的检索增强生成:13 种开源大型语言模型的研究

计算与语言 2025-03-24 v1 人工智能 机器学习

摘要

在将大型语言模型(LLM)应用于敏感且领域特定的任务时,如回答与《古兰经》相关的查询,准确且在上下文上的忠实响应至关重要。通用型 LLM 常常会出现幻觉,即生成的响应偏离权威来源,这引发了对其在宗教语境下可靠性的担忧。这一挑战凸显了需要整合领域特定知识以保持响应准确性、相关性和忠实性的系统需求。本研究考察了 13 种开源 LLM,按大小分为大型(如 Llama3:70b、Gemma2:27b、QwQ:32b)、中型(如 Gemma2:9b、Llama3:8b)和小型(如 Llama3.2:3b、Phi3:3.8b)。采用检索增强生成(RAG)来弥补使用独立模型时的不足。本研究利用包括《古兰经》章节含义、历史背景及属性等在内的描述性《古兰经》数据集,使模型在作答前能够获取相关知识。模型采用由人类评估者设定的三个关键指标进行评估:上下文相关性、答案忠实性和答案相关性。研究结果表明,大型模型在捕捉查询语义和生成准确、在上下文中依托的响应方面始终优于小型模型。尽管 Llama3.2:3b 被视为小型模型,但在忠实性(4.619)和相关性(4.857)方面表现优异,显示出经过良好优化的小型架构的潜力。本文考察了模型规模、计算效率与响应质量之间的权衡,探讨了在领域特定应用中使用 LLM 的挑战。

关键词

引用

@article{arxiv.2503.16581,
  title  = {Investigating Retrieval-Augmented Generation in Quranic Studies: A Study of 13 Open-Source Large Language Models},
  author = {Zahra Khalila and Arbi Haza Nasution and Winda Monika and Aytug Onan and Yohei Murakami and Yasir Bin Ismail Radi and Noor Mohammad Osmani},
  journal= {arXiv preprint arXiv:2503.16581},
  year   = {2025}
}

备注

11 pages, keywords: Large-language-models; retrieval-augmented generation; question answering; Quranic studies; Islamic teachings