印度放假判决-1200:面向印度司法 NLP 的多属性数据集
计算与语言
2025-07-04 v1 人工智能
机器学习
摘要
由于结构化数据集的稀缺,印度等地区的法律自然语言处理领域仍处于发展不足的状态。我们引入 IndianBailJudgments-1200,这是一个新的基准数据集,包含 1200 份印度法院关于放假决定的判决书,涵盖 20 多个属性,包括放假结果、IPC 条款、罪名类型及法律论证等。注释通过基于提示工程的 GPT-4o 流程生成,并进行一致性验证。该资源支持诸如结果预测、摘要生成和公平性分析等多种法律 NLP 任务,是首个专注于印度放假判例的公开数据集。
引用
@article{arxiv.2507.02506,
title = {IndianBailJudgments-1200: A Multi-Attribute Dataset for Legal NLP on Indian Bail Orders},
author = {Sneha Deshmukh and Prathmesh Kamble},
journal= {arXiv preprint arXiv:2507.02506},
year = {2025}
}
备注
9 pages, 9 figures, 2 tables. Dataset available at Hugging Face and GitHub. Submitted to arXiv for open access