ArabLegalEval:评估大语言模型阿拉伯法律知识的多任务基准
星系天体物理
2024-08-16 v1
摘要
大语言模型(LLM)的快速发展在各类自然语言处理任务中带来了显著提升。然而,对LLM法律知识的评估,特别是阿拉伯语等非英语语言,仍然探索不足。为填补这一空白,我们引入了ArabLegalEval——一个用于评估LLM阿拉伯法律知识的多任务基准数据集。借鉴MMLU和LegalBench数据集的思路,ArabLegalEval由多个来源于沙特法律文件和合成问题的任务组成。在本工作中,我们旨在分析解决阿拉伯法律问题所需的能力,并对最先进LLM的性能进行基准测试。我们探讨了上下文学习(in-context learning)的影响,并研究了多种评估方法。此外,我们还探索了自动验证生成问题的工作流程,以提升数据集质量。我们对多语言和以阿拉伯语为中心的LLM(如GPT-4和Jais)进行了基准测试。我们还分享了创建数据集和验证的方法论,该方法可推广至其他领域。我们希望通过发布ArabLegalEval数据集和代码来加速阿拉伯法律领域的AI研究:https://github.com/Thiqah/ArabLegalEval
引用
@article{arxiv.2408.07984,
title = {Gravitational Lensing Reveals Cool Gas within 10-20 kpc around a Quiescent Galaxy},
author = {Tania M. Barone and Glenn G. Kacprzak and James W. Nightingale and Nikole M. Nielsen and Karl Glazebrook and Kim-Vy H. Tran and Tucker Jones and Hasti Nateghi and Keerthi Vasan G. C. and Nandini Sahu and Themiya Nanayakkara and Hannah Skobe and Jesse van de Sande and Sebastian Lopez and Geraint F. Lewis},
journal= {arXiv preprint arXiv:2408.07984},
year = {2024}
}
备注
accepted nature communications physics