LLM 对阵律师:在大型英国判例法数据集中识别简易判决子集
摘要
为了开展法律的计算研究,高效地识别与特定法律问题相关的法院判决数据集是一项至关重要且极具挑战性的工作。本研究填补了在处理大型法律语料库文献方面的空白,探讨了如何从庞大的英国法院判决语料库中分离出特定案件,在本例中为简易判决。我们对两种计算方法进行了比较分析:(1) 一种利用专家生成的关键词和逻辑算子的传统基于自然语言处理的方法,以及 (2) 一种利用 Claude 2 大语言模型基于特定内容提示对案件进行分类的创新应用。我们使用了包含 356,011 份英国法院判决的 Cambridge Law Corpus,并确定该大语言模型达到了 0.94 的加权 F1 分数,而关键词方法仅为 0.78。尽管进行了迭代细化,基于关键词的搜索逻辑仍无法捕捉法律语言中的细微差别。我们识别并提取了 3,102 个简易判决案件,从而能够描绘它们在时间跨度上跨英国各个法院的分布情况。本文在采用先进自然语言处理技术解决核心法律研究任务方面迈出了开创性的一步,展示了这些技术如何弥合系统性差距并提升法律信息的可及性。我们分享了提取的数据集指标,以支持对简易判决的进一步研究。
引用
@article{arxiv.2403.04791,
title = {LLM vs. Lawyers: Identifying a Subset of Summary Judgments in a Large UK Case Law Dataset},
author = {Ahmed Izzidien and Holli Sargeant and Felix Steffek},
journal= {arXiv preprint arXiv:2403.04791},
year = {2024}
}
备注
36 pages, 13 figures. This work was funded by the Nuffield Foundation grant Access to Justice Through Artificial Intelligence. The views expressed are those of the authors and not necessarily of the Foundation. Visit www.nuffieldfoundation.org. We are grateful to Nicola Mathew for excellent research assistance