大型语言模型在法律判决预测上的综合评测
计算与语言
2023-10-19 v1
摘要
大型语言模型(LLMs)已在法律等特定领域应用中展现出巨大潜力。然而,近期关于 GPT-4 法律评测的争议引发了人们对其在真实法律任务中表现的质疑。为系统考察其在法律领域的胜任能力,我们基于 LLMs 设计了实用的基线方案,并在法律判决预测任务上进行测试。在我们的方案中,LLMs 可独立作答开放式问题,或与信息检索(IR)系统协同以从类案中学习或求解简化的多选题。我们表明,提示中纳入的类案与多选项(即标签候选)有助于 LLMs 回忆对专业法律推理至关重要的领域知识。我们还呈现了一个引人深思的悖论:由于较弱 LLM 从强大 IR 系统获得的增益有限,IR 系统的表现反而优于 LLM+IR,此时 LLMs 的作用变得冗余。我们的评测流程可轻松扩展至其他任务,以助力其他领域的评测。代码见 https://github.com/srhthu/LM-CompEval-Legal
引用
@article{arxiv.2310.11761,
title = {A Comprehensive Evaluation of Large Language Models on Legal Judgment Prediction},
author = {Ruihao Shui and Yixin Cao and Xiang Wang and Tat-Seng Chua},
journal= {arXiv preprint arXiv:2310.11761},
year = {2023}
}
备注
EMNLP Findings 2023