TriBench-Ko:评估司法工作流程中的 LLM 风险
计算与语言
2026-05-06 v1
摘要
大型语言模型 (LLM) 正在越来越多地被集成到法律工作流程中。然而,现有基准主要针对代理任务(如法律考试成绩或分类),无法捕捉日常司法流程中所涉及的实际性能与风险。为此,我们公开发布 TriBench-Ko,一个面向韩语的基准,用于评估 LLM 在经验证司法任务要求情境下的潜在部署风险。它涵盖四个核心任务:司法解释概述、先例检索、法律问题提取和证据分析。它综合评估模型在多个部署风险类别中的行为,包括不准确性(幻觉、遗漏、法规误用)、偏见(人口统计学偏见、过度合规)、不一致性(提示敏感性、非确定性)以及司法越界。每一项都旨在系统性地评估任务性能及特定风险类型,基于真实司法决策。我们对一系列当代 LLM 进行评估,发现许多模型经常表现出显著风险,尤其在先例检索方面存在困难,且未能捕捉关键法律信息。我们对这些 LLM 进行全面诊断,指出在司法语境中 LLM 生成输出的关键区域需要严格审查和谨慎。我们的数据集和代码已在 https://github.com/holi-lab/TriBench-Ko 上公开。
引用
@article{arxiv.2605.03792,
title = {TriBench-Ko: Evaluating LLM Risks in Judicial Workflows},
author = {Haesung Lee and Gyubin Choi and Eun-Ju Lee and So-Min Lee and Youkang Ko and Dogyoon Lim and Sung-Kyoung Jang and Yohan Jo},
journal= {arXiv preprint arXiv:2605.03792},
year = {2026}
}
备注
10 pages