中文

印度放假判决-1200:面向印度司法 NLP 的多属性数据集

计算与语言 2025-07-04 v1 人工智能 机器学习

摘要

由于结构化数据集的稀缺,印度等地区的法律自然语言处理领域仍处于发展不足的状态。我们引入 IndianBailJudgments-1200,这是一个新的基准数据集,包含 1200 份印度法院关于放假决定的判决书,涵盖 20 多个属性,包括放假结果、IPC 条款、罪名类型及法律论证等。注释通过基于提示工程的 GPT-4o 流程生成,并进行一致性验证。该资源支持诸如结果预测、摘要生成和公平性分析等多种法律 NLP 任务,是首个专注于印度放假判例的公开数据集。

关键词

引用

@article{arxiv.2507.02506,
  title  = {IndianBailJudgments-1200: A Multi-Attribute Dataset for Legal NLP on Indian Bail Orders},
  author = {Sneha Deshmukh and Prathmesh Kamble},
  journal= {arXiv preprint arXiv:2507.02506},
  year   = {2025}
}

备注

9 pages, 9 figures, 2 tables. Dataset available at Hugging Face and GitHub. Submitted to arXiv for open access