MizanQA: 评估大语言模型在摩洛哥法律问答任务中的表现
计算与语言
2025-08-25 v1 人工智能
信息检索
摘要
大语言模型(LLM)的快速发展显著推动了自然语言处理(NLP)领域的进展。然而,其在专门且资源有限的领域——例如阿拉伯语法律语境——中的有效性仍有限。本文引入MizanQA(读作Mizan,意为阿拉伯语的“尺度”,象征公正的普遍符号),用于评估大语言模型在摩洛哥法律问答(QA)任务中的表现,该基准数据集包含丰富的语言和法律复杂性。数据集基于现代标准阿拉伯语、伊斯兰马利克学派法学、摩洛哥习惯法以及法国法律影响力。该数据集包含超过1,700个多选问答题,包括多答案格式,MizanQA捕捉了真实法律推理的细微差别。通过对多语言和阿拉伯语聚焦型大语言模型进行基准测试实验,发现其表现存在显著差距,凸显了针对特定评估指标和文化基础、领域特定大语言模型开发的必要性。
关键词
引用
@article{arxiv.2508.16357,
title = {MizanQA: Benchmarking Large Language Models on Moroccan Legal Question Answering},
author = {Adil Bahaj and Mounir Ghogho},
journal= {arXiv preprint arXiv:2508.16357},
year = {2025}
}