大语言模型能否忠实地写作?基于代理的伊斯兰内容生成评估
计算与语言
2025-10-29 v1 人工智能
计算机与社会
多智能体系统
摘要
大语言模型日益增多地被用于伊斯兰指导,但存在引用文本错误、正确性应用不当或产生文化不一致响应的风险。我们对GPT-4o、Ansari AI和Fanar在来自真实伊斯兰博客的提示词上进行了评估。我们的双代理框架使用定量代理进行引用验证和六维评分(例如:结构、伊斯兰一致性、引用),以及用于五维side-by-side比较的定性代理(例如:语气、深度、原创性)。GPT-4o在伊斯兰准确性(3.93)和引用(3.38)方面得分最高,Ansari AI紧随其后(3.68,3.32),Fanar则落后(2.76,1.82)。尽管性能相对较强,模型仍未能可靠地产生准确的伊斯兰内容和引用——这在信仰敏感写作中是首要要求。GPT-4o获得了最高的平均定量得分(3.90/5),而Ansari AI在定性成对获胜方面领先(116/200)。Fanar虽然落后,但引入了针对伊斯兰和阿拉伯语境的创新。本研究凸显了以穆斯林视角为中心的社区驱动基准测试的必要性,为更可靠的AI在伊斯兰知识以及其他高风险领域(如医学、法律和新闻)中发挥作用提供了早期步骤。
引用
@article{arxiv.2510.24438,
title = {Can LLMs Write Faithfully? An Agent-Based Evaluation of LLM-generated Islamic Content},
author = {Abdullah Mushtaq and Rafay Naeem and Ezieddin Elmahjub and Ibrahim Ghaznavi and Shawqi Al-Maliki and Mohamed Abdallah and Ala Al-Fuqaha and Junaid Qadir},
journal= {arXiv preprint arXiv:2510.24438},
year = {2025}
}
备注
Accepted at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: 5th Muslims in Machine Learning (MusIML) Workshop