中文

面向古兰经问答的跨语言方法

计算与语言 2025-01-30 v1 信息检索

摘要

问答系统在资源有限、数据稀缺的语种上面临关键性局限,这使得开发鲁棒模型尤为困难。古兰经问答系统具有重要意义,因为它有助于更深入地理解《古兰经》——这部全球十多亿人奉为神圣的文本。然而,这些系统面临独特挑战,包括以现代标准阿拉伯语书写的问题与以古典阿拉伯语写成的古兰经经文答案之间的语言差异,以及现有数据集规模较小,进一步限制了模型性能。为应对这些挑战,我们采用跨语言方法,通过 (1) 数据集增强:利用机器翻译将阿拉伯语问题转换为英语,通过改写问题创造语言多样性,并从《古兰经》的英译本中检索答案以契合多语言训练需求;以及 (2) 语言模型微调:利用 BERT-Medium、RoBERTa-Base、DeBERTa-v3-Base、ELECTRA-Large、Flan-T5、Bloom 和 Falcon 等预训练模型来满足古兰经问答的特殊需求。实验结果表明,该跨语言方法显著提升了模型性能,其中 RoBERTa-Base 取得了最高的 MAP@10 (0.34) 与 MRR (0.52),而 DeBERTa-v3-Base 在 Recall@10 (0.50) 与 Precision@10 (0.24) 上表现最佳。这些发现凸显了跨语言策略在克服语言障碍和推进古兰经问答系统方面的有效性。

关键词

引用

@article{arxiv.2501.17449,
  title  = {Cross-Language Approach for Quranic QA},
  author = {Islam Oshallah and Mohamed Basem and Ali Hamdi and Ammar Mohammed},
  journal= {arXiv preprint arXiv:2501.17449},
  year   = {2025}
}