LAiW:一个中文法律大语言模型评测基准
计算与语言
2024-02-20 v2
摘要
通用与法律领域 LLM 已在 LegalAI 的多种任务中展现出强劲性能。然而,当前对这些 LLM 在 LegalAI 中的评测由计算机科学专家定义,缺乏与法律实践逻辑的一致性,难以判断其实际能力。为应对该挑战,我们首次基于法律实践逻辑构建了中文法律 LLM 评测基准 LAiW。为契合法律专家的思维过程与法律实践(三段论),我们将 LLM 的法律能力由易到难划分为三个层级:基础信息检索、法律基础推理与复杂法律应用。每一层级包含多项任务以确保全面评测。通过对当前通用与法律领域 LLM 在我们的基准上的自动化评测,我们指出这些 LLM 可能未与法律实践逻辑对齐。LLM 看似能直接获得复杂法律应用能力,却在一些基础任务上表现不佳,这可能对其实际应用及法律专家的接受度构成障碍。为进一步确认当前 LLM 在法律应用场景中的复杂法律应用能力,我们还引入了法律专家的人工评测。结果表明,尽管 LLM 可能展现强劲性能,仍须强化法律逻辑。
引用
@article{arxiv.2310.05620,
title = {LAiW: A Chinese Legal Large Language Models Benchmark},
author = {Yongfu Dai and Duanyu Feng and Jimin Huang and Haochen Jia and Qianqian Xie and Yifang Zhang and Weiguang Han and Wei Tian and Hao Wang},
journal= {arXiv preprint arXiv:2310.05620},
year = {2024}
}