再见,蓝皮书?利用大语言模型自动化法律程序
计算与语言
2025-05-06 v1 人工智能
计算机与社会
摘要
法律实践要求严格遵守程序规则。在美国,很少有比《蓝皮书:统一引用系统》中发现的规则更复杂的了。遵守这个系统超过 500 页的繁琐格式说明,是成千上万学生法律评论编辑存在的理由,也是各地律师的眼中钉。为了评估大语言模型(LLMs)是否能够遵守如此复杂系统的程序,我们构建了一个包含 866 个蓝皮书任务的原始数据集,并测试了来自 OpenAI、Anthropic、Google、Meta 和 DeepSeek 的旗舰 LLMs。我们表明:(1) 这些模型仅在 69%-74% 的情况下能生成完全合规的蓝皮书引用;(2) 基于蓝皮书底层规则系统的上下文学习仅将准确率提高到 77%。这些结果警示我们,在程序保真度至关重要的法律领域,不应使用现成的 LLMs 来自动化某些方面。
引用
@article{arxiv.2505.02763,
title = {Bye-bye, Bluebook? Automating Legal Procedure with Large Language Models},
author = {Matthew Dahl},
journal= {arXiv preprint arXiv:2505.02763},
year = {2025}
}