大语言模型的自动化法律写作评估
计算与语言
2025-05-01 v1 人工智能
摘要
尽管近期在大型语言模型方面取得了进展,但用于评估法律写作的基准数据仍显�少,这源于评估此类领域中开放式响应的内在复杂性。评估特定领域任务的语言模型的一个关键挑战是寻找公开、频繁更新且包含全面评估指南的测试数据集。巴西执业资格考试恰好满足这些要求。我们引入oab-bench,一个包含来自近期考试七个法律领域的105个问题的基准。该基准包含全面的评估指南和参考材料,这些材料由人类考官使用以确保评分一致性。我们对四个大型语言模型在oab-bench上进行评估,发现Claude-3.5 Sonnet取得最佳成绩,平均得分为10分中的7.93,通过了所有21场考试。我们还调查了大型语言模型是否可以作为可靠的自动评判家来评估法律写作。我们的实验表明,像OpenAI的o1这样的前沿模型在评估批准的考试时与人类得分之间取得了强相关,这表明尽管法律写作评估具有内在的主观性,前沿模型仍可作为可靠的自动评估者。该项目的源代码和基准——包括问题、评估指南、模型生成的响应及其相应的自动评估——均公开可用。
引用
@article{arxiv.2504.21202,
title = {Automatic Legal Writing Evaluation of LLMs},
author = {Ramon Pires and Roseval Malaquias Junior and Rodrigo Nogueira},
journal= {arXiv preprint arXiv:2504.21202},
year = {2025}
}