面向伊斯兰文本非事实性问答的更大上下文基准数据集
计算与语言
2024-09-17 v1 机器学习
摘要
在当今数字时代,获取和理解宗教文本,特别是《古兰经》(伊斯兰教的圣典)和《圣训》(先知穆罕默德言论或传统的汇编),需要高效准确的问答(QA)系统。然而,专门针对《古兰经》经注学(Tafsir,对《古兰经》的解释、阐释和背景说明)和《圣训》详细查询的问答系统十分匮乏,这构成了重大挑战。为弥补这一空白,我们引入了一个为《古兰经》经注学和《圣训》领域问答目的而精心构建的综合数据集。该数据集包含超过73,000个问答对,是这一专业领域内报告的最大数据集。重要的是,数据集中的问题和答案都经过精心丰富,包含了上下文信息,为训练和评估定制化的问答系统提供了宝贵的资源。然而,尽管本文强调了该数据集的贡献并建立了评估《古兰经》和《圣训》领域问答性能的基准,我们随后的人工评估揭示了现有自动评估技术局限性的关键见解。自动评估指标(如ROUGE分数)与人工评估之间的差异变得明显。人工评估显示出显著差异:模型与专家学者的判断一致性在11%到20%之间,而其上下文理解能力则跨越了50%到90%的更广范围。这些发现强调了需要能够捕捉理解宗教文本所固有的细微差别和复杂性的评估技术,以超越传统自动指标的局限性。
引用
@article{arxiv.2409.09844,
title = {A Benchmark Dataset with Larger Context for Non-Factoid Question Answering over Islamic Text},
author = {Faiza Qamar and Seemab Latif and Rabia Latif},
journal= {arXiv preprint arXiv:2409.09844},
year = {2024}
}