法律专家不同意用于解释欧洲人权法院案件结果分类的原理提取技术
计算与语言
2026-04-08 v2
摘要
可解释性对于大语言模型(LLM)在法律领域的应用至关重要,因为信任和透明度是必不可少的。在此背景下,一个核心的NLP任务是法律结果预测,即模型预测法院是否会认定某项权利受到侵犯。我们研究了欧洲人权法院(ECtHR)判决中的这一任务,引入了一个新的ECtHR数据集,其中包含精心筛选的肯定(侵权)和否定(非侵权)案例。现有工作提出了任务特定方法和模型无关技术来解释下游性能,但尚不清楚哪种技术最能解释法律结果预测。为了解决这个问题,我们提出了一个用于模型无关可解释性方法的比较分析框架。我们专注于两种原理提取技术,这些技术通过输入中的简洁、人类可解释的文本片段来证明模型输出。我们通过归一化充分性和全面性指标评估忠实度,并通过法律专家对提取原理的判断来评估合理性。我们还评估了使用LLM作为评判者的可行性,并以这些专家评估作为参考。我们在新ECtHR数据集上的实验表明,尽管忠实度得分很高,但模型预测侵权的“理由”与法律专家的理由存在显著差异。我们实验的源代码可在https://github.com/trusthlt/IntEval公开获取。
引用
@article{arxiv.2601.12419,
title = {Legal Experts Disagree With Rationale Extraction Techniques for Explaining ECtHR Case Outcome Classification},
author = {Mahammad Namazov and Tomáš Koref and Ivan Habernal},
journal= {arXiv preprint arXiv:2601.12419},
year = {2026}
}
备注
9 pages + Appendix