中文

德国法院裁决的分段与处理——基于开放法律数据的研究

计算与语言 2026-01-06 v1 信息检索 机器学习

摘要

结构化法律数据的可用性对于推动德国法律系统的自然语言处理技术至关重要。最常用的数据集之一是 Open Legal Data,提供了大规模的德国法院裁决集合。尽管该原始数据集的元数据结构一致,但裁决文本的格式不一致,常缺乏明确标记的章节。可靠的章节分离不仅对修辞角色分类至关重要,也对后续任务如检索和引用分析至关重要。本文中,我们引入了一个来自官方 Open Legal Data 数据集的清洁并分段后的 251,038 份德国法院裁决数据集。我们系统性地分离了德国法院裁决中三个重要的章节,即 Tenor(裁决的操作性部分)、Tatbestand(案件事实)和 Entscheidungsgrunde(司法推理),这些章节在原始数据集中往往不一致或缺失。为确保提取过程的可靠性,我们采用 95% 置信水平和 5% 误差范围的 Cochran 公式,抽取 384 份具有统计代表性的随机样本,并手动验证所有三个章节均正确识别。我们还将 Rechtsmittelbelehrung(上诉通知)作为独立字段提取,因其属于程序指令,而非裁决本身的一部分。最终得到的语料库以 JSONL 格式公开,为进一步研究德国法律系统提供了可访问资源。

关键词

引用

@article{arxiv.2601.01449,
  title  = {Segmentation and Processing of German Court Decisions from Open Legal Data},
  author = {Harshil Darji and Martin Heckelmann and Christina Kratsch and Gerard de Melo},
  journal= {arXiv preprint arXiv:2601.01449},
  year   = {2026}
}

备注

Accepted and published as a research article in Legal Knowledge and Information Systems (JURIX 2025 proceedings, IOS Press). Pages 276--281