QASiNa:基于先知传记的宗教领域问答
摘要
如今,问答(QA)任务受到显著的研究关注,特别是随着大型语言模型(LLM)如 Chat GPT [1] 的发展。LLM 可应用于各种领域,但应用于伊斯兰领域时与信息传输原则相悖。在伊斯兰中,我们严格规定信息来源以及谁可以对该来源进行解释或 tafseer(注释)[2]。LLM 基于自身解释生成答案的方法类似于 tafseer 的概念,LLM 既不是伊斯兰专家也不是人类,而这在伊斯兰中是不被允许的。印度尼西亚是世界上伊斯兰信徒人口最多的国家 [3]。随着 LLM 的高影响力,我们需要对 LLM 在宗教领域的表现进行评估。目前可用的宗教问答数据集很少,且没有一个使用先知传记(Sirah Nabawiyah),尤其是印尼语的。在本文中,我们提出了 Question Answering Sirah Nabawiyah(QASiNa)数据集,一个从印尼语先知传记文献编译而成的新数据集。我们通过使用 mBERT [4]、XLM-R [5] 和 IndoBERT [6] 来展示我们的数据集,这些模型用印尼语翻译的 SQuAD v2.0 [7] 进行了微调。XLM-R 模型在 QASiNa 上返回了最佳性能,EM 为 61.20,F1-Score 为 75.94,Substring Match 为 70.00。我们将 XLM-R 的性能与 Chat GPT-3.5 和 GPT-4 [1] 进行比较。两个 Chat GPT 版本返回了较低的 EM 和 F1-Score 以及较高的 Substring Match,且 EM 与 Substring Match 的差距在 GPT-4 中更大。实验表明,Chat GPT 倾向于给出过度解释,这由其较高的 Substring Match 分数相对于 EM 和 F1-Score 得以证明,即使在提供指令和上下文后也是如此。这得出结论:Chat GPT 不适合宗教领域尤其是伊斯兰教的问答任务。
引用
@article{arxiv.2310.08102,
title = {QASiNa: Religious Domain Question Answering using Sirah Nabawiyah},
author = {Muhammad Razif Rizqullah and Ayu Purwarianti and Alham Fikri Aji},
journal= {arXiv preprint arXiv:2310.08102},
year = {2023}
}
备注
6 Pages. In Proceeding of 10th International Conference on Advanced Informatics: Concepts, Theory and Applications (ICAICTA 2023)