中文

LegalAgentBench:评估法律领域LLM代理

计算与语言 2024-12-24 v1 信息检索

摘要

随着LLM代理智能力和自主性的增加,它们在法律领域的潜在应用日益增多。然而,现有的通用领域基准测试无法完全捕捉真实世界司法认知和决策的复杂性和细微细节。因此,我们提出LegalAgentBench,一个专为评估中国法律领域LLM代理而设计的全面基准测试。LegalAgentBench包括来自真实世界法律场景的17个语料库,并提供37个用于与外部知识交互的工具。我们设计了一个可扩展的任务构建框架,并仔细标注了300个任务。这些任务涵盖多种类型,包括多跳推理和写作,跨越不同的难度水平,有效反映真实世界法律场景的复杂性。此外,除了评估最终成功之外,LegalAgentBench还包括关键词分析以计算进度率,实现更细粒度的评估。我们评估了八个流行的LLM,凸显了现有模型和方法的优势、局限性以及潜在改进领域。LegalAgentBench为LLM在法律领域的实际应用设定了新的基准,其代码和数据可在\url{https://github.com/CSHaitao/LegalAgentBench}获取。

关键词

引用

@article{arxiv.2412.17259,
  title  = {LegalAgentBench: Evaluating LLM Agents in Legal Domain},
  author = {Haitao Li and Junjie Chen and Jingli Yang and Qingyao Ai and Wei Jia and Youfeng Liu and Kai Lin and Yueyue Wu and Guozhi Yuan and Yiran Hu and Wuyue Wang and Yiqun Liu and Minlie Huang},
  journal= {arXiv preprint arXiv:2412.17259},
  year   = {2024}
}

备注

23 pages