中文

大语言模型审判:评估大模型的司法公平性

计算与语言 2025-08-05 v2

摘要

大型语言模型(LLMs)在越来越多的高风险领域被用于做出决策,这些决策影响权利和公平性。然而,LLMs的司法公平性及其对社会正义的影响尚未得到充分探讨。当LLMs充当法官时,其公平解决司法问题的能力是确保其可信度的前提。基于司法公平理论,我们构建了一个全面的框架来衡量LLM的公平性,从而确定65个标签及其161个对应的值。将该框架应用于司法系统,我们构建了一个包含177,100个独特案件事实的广泛数据集JudiFair。为实现稳健的统计推断,我们开发了三个评估指标:一致性、偏差和不平衡误差,并引入一种方法来评估多个LLMs在各种标签上的整体公平性。通过对16个LLMs进行实验,我们发现模型之间普遍存在不一致性、偏差和不平衡误差,凸显了LLMs严重的司法不公平问题。特别是,LLMs在人口统计标签上显示出显著的偏差,而在 substance 标签上相对较少偏差,程序标签则偏差更大。有趣的是,一致性增加与偏差降低相关,但更准确的预测会加剧偏差。尽管我们发现调整温度参数可以影响LLMs的司法公平性,但模型规模、发布日期和国家来源并不显著影响司法公平性。因此,我们引入了一个公开的工具包,包含所有数据集和代码,旨在支持未来评估和改进LLM公平性的研究。

关键词

引用

@article{arxiv.2507.10852,
  title  = {LLMs on Trial: Evaluating Judicial Fairness for Large Language Models},
  author = {Yiran Hu and Zongyue Xue and Haitao Li and Siyuan Zheng and Qingjing Chen and Shaochun Wang and Xihan Zhang and Ning Zheng and Yun Liu and Qingyao Ai and Yiqun Liu and Charles L. A. Clarke and Weixing Shen},
  journal= {arXiv preprint arXiv:2507.10852},
  year   = {2025}
}