中文

评估司法决策抽取的无监督指标

计算与语言 2025-10-03 v1 人工智能 信息检索

摘要

人工智能在法律自然语言处理领域的快速发展要求可扩展的方法来评估司法决策文本抽取。本研究评估了 16 项无监督指标(包括新形式),用于评估从 1000 份匿名俄罗斯司法决策中抽取七个语义块的质量,这些语义块经 7168 项专家评论在 1--5 Likert 比例尺上验证。这些指标跨文档、语义、结构、伪真实值和法律特定类别,均无需预先标注真实值。自助抽样相关性、Lin 不敏感相关系数 (CCC) 和平均绝对误差 (MAE) 结果显示,术语频率一致性 (Pearson r=0.540r = 0.540,Lin CCC = 0.512,MAE = 0.127) 和覆盖率/块完整性 (Pearson r=0.513r = 0.513,Lin CCC = 0.443,MAE = 0.139) 最能与专家评分一致,而法律术语密度 (Pearson r=0.479r = -0.479,Lin CCC = -0.079,MAE = 0.394) 表现出强负相关。大语言模型评估分数 (mean = 0.849,Pearson r=0.382r = 0.382,Lin CCC = 0.325,MAE = 0.197) 表现出中等一致性,但其性能使用 gpt-4.1-mini via g4f,表明其为法律文本的专业化程度有限。这些发现表明,无监督指标(包括基于大语言模型的方法)可实现可扩展的筛选,但由于相关性适中且 CCC 值较低,无法完全取代高风险法律情境中的人类判断。本工作推进了法律 NLP,通过提供无标注评估工具,具有促进司法分析和伦理 AI 部署的意义。

关键词

引用

@article{arxiv.2510.01792,
  title  = {Comparison of Unsupervised Metrics for Evaluating Judicial Decision Extraction},
  author = {Ivan Leonidovich Litvak and Anton Kostin and Fedor Lashkin and Tatiana Maksiyan and Sergey Lagutin},
  journal= {arXiv preprint arXiv:2510.01792},
  year   = {2025}
}

备注

28 pages