JustEva:用于评估法律知识推理中 LLM 公平性的工具包
人工智能
2025-09-16 v1
摘要
将大型语言模型(LLM)引入法律实践引发了对司法公平性的迫切担忧,这主要归因于其“黑盒”过程的性质。本研究介绍了 JustEva,一个旨在衡量法律任务中 LLM 公平性的综合性开源评估工具包。JustEva 具有以下几项优势:(1)涵盖 65 个法外因素的结构化标签系统;(2)三个核心公平性指标——不一致性、偏见和不平衡的不准确性;(3)稳健的统计推断方法;(4)信息丰富的可视化。该工具包支持两类实验,实现了完整的评估工作流:(1)使用提供的数据集从 LLM 生成结构化输出;(2)通过回归及其他统计方法对 LLM 的输出进行统计分析和推断。JustEva 的实证应用揭示了当前 LLM 存在显著的公平性缺陷,凸显了公平且可信赖的 LLM 法律工具的匮乏。JustEva 为评估和改进法律领域的算法公平性提供了便捷的工具与方法论基础。
引用
@article{arxiv.2509.12104,
title = {JustEva: A Toolkit to Evaluate LLM Fairness in Legal Knowledge Inference},
author = {Zongyue Xue and Siyuan Zheng and Shaochun Wang and Yiran Hu and Shenran Wang and Yuxin Yao and Haitao Li and Qingyao Ai and Yiqun Liu and Yun Liu and Weixing Shen},
journal= {arXiv preprint arXiv:2509.12104},
year = {2025}
}
备注
This paper has been accepted at CIKM 2025 (Demo Track)