中文

印度的结构化法律文书生成:基于 VidhikDastaavej 的模型无关包装器方法

计算与语言 2026-03-26 v2 人工智能 信息检索 机器学习

摘要

自动化法律文书起草可以提高效率并减轻人工法律工作的负担。然而,由于公共数据集的稀缺以及将模型适配于长篇法律起草的复杂性,私有法律文书的结构化生成仍然未被充分探索,尤其是在印度语境下。为了填补这一空白,我们引入了 VidhikDastaavej,这是一个与一家印度律师事务所合作整理的大规模、匿名化的私有法律文书数据集。该数据集涵盖 133 个不同类别,是同类首个资源,为结构化法律文本生成及更广泛的 Legal AI 研究奠定了基础。我们进一步提出了一种模型无关包装器(MAW),这是一个两阶段生成框架,首先规划法律草案的章节结构,然后使用基于检索的提示生成每个章节。MAW 不依赖于任何特定的 LLM,使其能够适配开源和闭源模型。综合评估(包括词汇、语义、基于 LLM 的评估以及具有标注者间一致性的专家驱动评估)表明,与微调基线相比,该包装器在事实准确性、连贯性和完整性方面均有显著提升。这项工作建立了一个新的基准数据集和一个可泛化的生成框架,为未来 AI 辅助法律起草的研究铺平了道路。

关键词

引用

@article{arxiv.2504.03486,
  title  = {Structured Legal Document Generation in India: A Model-Agnostic Wrapper Approach with VidhikDastaavej},
  author = {Shubham Kumar Nigam and Balaramamahanthi Deepak Patnaik and Noel Shallum and Kripabandhu Ghosh and Arnab Bhattacharya},
  journal= {arXiv preprint arXiv:2504.03486},
  year   = {2026}
}

备注

Paper accepted in the Language Resources and Evaluation Conference (LREC) 2026 conference