中文

挖掘法律论证以研究司法形式主义

计算与语言 2026-03-24 v2 计算机与社会

摘要

法院必须为其判决提供理由,但大规模系统地分析司法推理仍然困难。本研究通过开发自动化方法,利用最先进的自然语言处理技术检测并分类捷克最高法院判决中的司法推理,从而检验了关于中东欧(CEE)形式主义审判的主张。我们创建了MADON数据集,包含来自两家捷克最高法院的272份判决,以及9,183个段落的专家标注(涵盖八种论证类型)和用于监督训练与评估的整体形式主义标签。利用包含300,511份捷克法院判决的语料库,我们通过持续预训练将Transformer LLM适配到捷克法律领域,并实验了包括非对称损失和类别加权在内的方法以解决数据集不平衡问题。最佳模型能够检测论证性段落(82.6% Bal-F1)、分类传统法律论证类型(77.5% Bal-F1),并将判决分类为形式主义/非形式主义(83.8% Bal-F1)。我们结合ModernBERT、Llama 3.1和传统基于特征的机器学习的三阶段流水线在判决分类上取得了有希望的结果,同时降低了计算成本并提高了可解释性。在经验层面,我们挑战了关于CEE形式主义的流行叙事。我们证明法律论证挖掘能够实现有希望的司法哲学分类,并突出了其在计算法学其他重要任务中的潜力。我们的方法可跨司法管辖区使用,我们的整个流水线、数据集、指南、模型和源代码可在 https://github.com/trusthlt/madon 获取。

关键词

引用

@article{arxiv.2512.11374,
  title  = {Mining Legal Arguments to Study Judicial Formalism},
  author = {Tomáš Koref and Lena Held and Mahammad Namazov and Harun Kumru and Yassine Thlija and Ivan Habernal},
  journal= {arXiv preprint arXiv:2512.11374},
  year   = {2026}
}

备注

pre-print under review