中文

LexGenius:面向大型语言模型法律通用智能的专家级基准测试

计算与语言 2026-04-17 v3

摘要

法律通用智能(GI)是指涵盖法律理解、推理和决策的人工智能(AI),模拟法律专家跨领域的专业能力。然而,现有基准测试以结果为导向,未能系统地评估大型语言模型(LLM)的法律智能,阻碍了法律通用智能的发展。为此,我们提出了LexGenius,一个用于评估LLM法律通用智能的专家级中文法律基准。它遵循维度-任务-能力框架,涵盖七个维度、十一个任务和二十种能力。我们利用近期法律案例和考试题目创建选择题,并结合人工与LLM评审以降低数据泄露风险,通过多轮核查确保准确性和可靠性。我们使用LexGenius评估了12种最先进的大型语言模型并进行了深入分析。我们发现LLM在法律智能能力方面存在显著差异,即使最佳LLM也落后于人类法律专业人士。我们相信LexGenius能够评估LLM的法律智能能力并促进法律通用智能的发展。我们的项目地址为 https://github.com/QwenQKing/LexGenius。

关键词

引用

@article{arxiv.2512.04578,
  title  = {LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence},
  author = {Wenjin Liu and Haoran Luo and Xin Feng and Xiang Ji and Lijuan Zhou and Rui Mao and Jiapu Wang and Shirui Pan and Erik Cambria},
  journal= {arXiv preprint arXiv:2512.04578},
  year   = {2026}
}