中文

德国法典的文本分块

计算与语言 2026-05-20 v1 人工智能

摘要

本文以《德国民法典》作为结构化基准语料库,研究了面向德国成文法的检索增强生成的分块策略。我们实现并比较了一系列分割方法,包括结构单元(条、款、句、命题)、固定大小窗口、上下文分块、语义聚类、Lumber 式分块以及基于 RAPTOR 的层次化检索。所有方法均在具有条级别黄金标签的法律问答数据集上进行评估,衡量召回率、查询延迟、索引构建时间和存储需求。结果表明,与固有法律结构对齐的分块策略——特别是基于条和款的检索——实现了最高的召回率,而覆盖此结构的更复杂方法则表现更差。与上下文分块、RAPTOR 和 Lumber 等大语言模型密集型技术相比,这些更简单的方法还提供了有利的计算效率。研究结果凸显了语义丰富度与运营成本之间的关键权衡,并证明保留领域特定结构对于有效的法律信息检索至关重要。

关键词

引用

@article{arxiv.2605.19806,
  title  = {Chunking German Legal Code},
  author = {Max Prior and Natalia Milanova and Andreas Schultz},
  journal= {arXiv preprint arXiv:2605.19806},
  year   = {2026}
}