中文

神圣还是合成?评估大语言模型在宗教问题上的可靠性与拒答能力

计算与语言 2025-08-13 v1 人工智能 计算机与社会

摘要

尽管大语言模型(LLMs)在回答各领域问题中的应用日益广泛,但其在包括宗教领域在内的众多领域中的可靠性和准确性仍未得到检验。本文提出了一个新颖的基准测试 FiqhQA,专注于由大语言模型生成的伊斯兰教法裁决,这些裁决按四大逊尼派教法学派明确分类,并提供阿拉伯语和英语版本。与以往要么忽视宗教教法学派之间的区别,要么未能评估拒答行为的研究不同,我们不仅评估大语言模型的准确性,还评估其识别何时不应作答的能力。我们的零样本和拒答实验揭示了不同大语言模型、语言和教法学派之间存在显著差异。虽然 GPT-4o 在准确性上优于所有其他模型,但 Gemini 和 Fanar 展示了更优的拒答行为,这对于最小化自信的错误回答至关重要。值得注意的是,所有模型在阿拉伯语中的表现均有所下降,突显了在英语以外的语言中进行宗教推理的局限性。据我们所知,这是首个针对细粒度的伊斯兰教法学派特定裁决生成对大语言模型效能进行基准测试,并评估其在伊斯兰法学查询中拒答行为的研究。我们的研究结果强调了在宗教应用中需要针对特定任务进行评估并谨慎部署大语言模型。

关键词

引用

@article{arxiv.2508.08287,
  title  = {Sacred or Synthetic? Evaluating LLM Reliability and Abstention for Religious Questions},
  author = {Farah Atif and Nursultan Askarbekuly and Kareem Darwish and Monojit Choudhury},
  journal= {arXiv preprint arXiv:2508.08287},
  year   = {2025}
}

备注

8th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2025)