利用大语言模型识别法律判决要旨:关于性能、规模与记忆的系统性研究
计算与语言
2025-05-27 v3
摘要
随着大语言模型(LLMs)能力的持续进步,评估它们在既定基准上的表现至关重要。在本研究中,我们提出了一套实验,以评估现代LLMs(参数范围从3B到90B+)在CaseHOLD(一个用于识别案件判决要旨的法律基准数据集)上的性能。我们的实验展示了规模效应——该任务的性能随模型规模提升而改善,能力更强的模型如GPT4o和AmazonNovaPro分别取得了0.744和0.720的宏观F1分数。这些分数与该数据集上已发表的最佳结果具有竞争力,且无需任何技术上复杂的模型训练、微调或少样本提示。为确保这些强劲结果并非源于对训练数据中司法意见的记忆,我们开发并利用了一种新颖的引文匿名化测试,该测试在保持语义含义的同时确保案件名称和引用是虚构的。在这些条件下,模型保持了强劲的性能(宏观F1为0.728),表明其表现并非源于死记硬背。这些发现展示了LLMs在法律任务上的前景和当前局限,对自动化法律分析和法律基准的开发与衡量具有重要意义。
引用
@article{arxiv.2505.02172,
title = {Identifying Legal Holdings with LLMs: A Systematic Study of Performance, Scale, and Memorization},
author = {Chuck Arvin},
journal= {arXiv preprint arXiv:2505.02172},
year = {2025}
}
备注
Presented as a short paper at International Conference on Artificial Intelligence and Law 2025 (Chicago, IL)