公平性非统计:机器学习在评估法律推理中的局限性
计算与语言
2025-06-05 v1 机器学习
摘要
法律决策越来越被用于评估其公平性、一致性和偏见。在像难民审查这样的高风险领域,这些方法常常被应用于检测结果中的差异。然而,统计方法是否能够在受制于自由裁量、规范复杂性和有限真相的法律语境中有意义地评估公平性,仍不明确。本文我们在一大真实世界数据集(超过 59,000 份加拿大难民决策 AsyLex)上,实证评估了三种常见的机器学习方法(基于特征的分析、语义聚类和预测建模)。我们的实验表明,这些方法会产生差异甚至相互矛盾的信号,预测建模往往依赖于情境和程序特征而非法律特征,语义聚类未能捕捉实质性的法律推理。我们指出了统计公平评估的局限性,挑战了统计规律等同于公平的假设,并认为当前的计算方法不足以评估在法律自由裁量域中的公平性。我们认为,在法律中评估公平性需要的方法不仅要基于数据,还要基于法律推理和制度背景。
引用
@article{arxiv.2506.03913,
title = {When Fairness Isn't Statistical: The Limits of Machine Learning in Evaluating Legal Reasoning},
author = {Claire Barale and Michael Rovatsos and Nehal Bhuta},
journal= {arXiv preprint arXiv:2506.03913},
year = {2025}
}
备注
Preprint