LawBench:大型语言模型法律知识的基准测试
计算与语言
2023-09-29 v1 人工智能
机器学习
摘要
大型语言模型(LLMs)已在多方面展现出强大能力。然而,当将其应用于高度专业化、安全关键的法律领域时,它们拥有多少法律知识以及能否可靠执行法律相关任务尚不清楚。为弥补这一差距,我们提出一个综合评估基准 LawBench。LawBench 经过精心构建,以从三个认知层面对 LLMs 的法律能力进行精确评估:(1)法律知识记忆:LLMs 能否记忆所需法律概念、条文与事实;(2)法律知识理解:LLMs 能否理解法律文本中的实体、事件与关系;(3)法律知识应用:LLMs 能否恰当利用其法律知识并作出必要推理步骤以解决现实法律任务。LawBench 包含 20 项多样任务,覆盖 5 种任务类型:单标签分类(SLC)、多标签分类(MLC)、回归、抽取与生成。我们对 51 个 LLMs 在 LawBench 上进行了广泛评估,包括 20 个多语言 LLMs、22 个中文导向 LLMs 和 9 个法律专用 LLMs。结果显示 GPT-4 仍是法律领域最佳表现的 LLM,大幅超越其他模型。尽管在法律专用文本上微调 LLMs 带来一定提升,我们距离获得可用且可靠的法律任务 LLMs 仍有很长距离。所有数据、模型预测与评估代码发布于 https://github.com/open-compass/LawBench/。我们希望该基准提供对 LLMs 领域专用能力的深入认识,并加速法律领域 LLMs 的发展。
引用
@article{arxiv.2309.16289,
title = {LawBench: Benchmarking Legal Knowledge of Large Language Models},
author = {Zhiwei Fei and Xiaoyu Shen and Dawei Zhu and Fengzhe Zhou and Zhuo Han and Songyang Zhang and Kai Chen and Zongwen Shen and Jidong Ge},
journal= {arXiv preprint arXiv:2309.16289},
year = {2023}
}