大型语言模型在法律应用中的评估:挑战、方法与未来方向
计算机与社会
2026-01-22 v1 人工智能
计算与语言
摘要
大型语言模型(LLM)正日益被整合到法律应用中,包括司法决策支持、法律实务辅助以及面向公众的法律服务。尽管 LLM 在处理法律知识和任务方面展现出强大潜力,但其在现实法律环境中的部署引发了超越表面准确性的关键担忧,涉及法律推理过程的健全性以及公平性和可靠性等可信度问题。因此,对 LLM 在法律任务中表现的系统评估已成为其负责任采用的必要条件。本综述识别了基于现实法律实务的 LLM 法律任务评估中的关键挑战。我们分析了评估 LLM 在法律领域表现所涉及的主要困难,包括结果正确性、推理可靠性和可信度。基于这些挑战,我们根据任务设计、数据集和评估指标回顾并分类了现有的评估方法和基准。我们进一步讨论了当前方法应对这些挑战的程度,强调了其局限性,并概述了未来研究方向,以期在法律领域为 LLM 构建更现实、可靠且具有法律依据的评估框架。
引用
@article{arxiv.2601.15267,
title = {Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions},
author = {Yiran Hu and Huanghai Liu and Chong Wang and Kunran Li and Tien-Hsuan Wu and Haitao Li and Xinran Xu and Siqing Huo and Weihang Su and Ning Zheng and Siyuan Zheng and Qingyao Ai and Yun Liu and Renjun Bian and Yiqun Liu and Charles L. A. Clarke and Weixing Shen and Ben Kao},
journal= {arXiv preprint arXiv:2601.15267},
year = {2026}
}