中文

LexEval:面向大语言模型的综合中文法律基准

计算与语言 2024-11-27 v4

摘要

大语言模型(LLM)在自然语言处理任务中取得显著进展,并在法律领域展现出巨大潜力。然而,法律应用对准确性、可靠性和公平性提出了严格要求。在未对LLMs的潜力与局限性进行仔细评估的情况下应用于法律系统,可能在法律实践中引发重大风险。为此,我们引入了一个标准化的综合中文法律基准LexEval。该基准在以下三个方面具有显著意义:(1)能力建模:我们提出了新的法律认知能力分类法,以组织不同任务。(2)规模:据我们了解,LexEval目前是最大的中文法律评估数据集,包含23个任务和14,150个问题。(3)数据:我们利用格式化的现有数据集、考试数据集和由法律专家注释的数据集,全面评估LLMs的各种能力。LexEval不仅关注LLMs应用基本法律知识的能力,也致力于检验其应用中涉及的伦理问题。我们对38个开源和商业LLMs进行评估,获得了一些有趣的发现。实验和发现为开发中文法律系统和LLM评估流程提供了宝贵的见解。LexEval数据集和排行榜已公开于\url{https://github.com/CSHaitao/LexEval},并将持续更新。

关键词

引用

@article{arxiv.2409.20288,
  title  = {LexEval: A Comprehensive Chinese Legal Benchmark for Evaluating Large Language Models},
  author = {Haitao Li and You Chen and Qingyao Ai and Yueyue Wu and Ruizhe Zhang and Yiqun Liu},
  journal= {arXiv preprint arXiv:2409.20288},
  year   = {2024}
}

备注

NeurIPs 2024