中文

ILSIC:用于通过非专业用户查询识别印度法律条文的语料库

计算与语言 2026-02-03 v1

摘要

法律条文识别(Legal Statute Identification, LSI)是Legal NLP中最基础的任务之一。该任务传统上使用来自法院判决的事实作为输入查询,因为判决数据丰富。然而,在实际应用中,输入查询可能是非正式的、由非专业人士提出。虽然已有少量非专业用户LSI数据集,但鲜有研究探讨法院数据与非专业用户数据的差异。本工作创建了ILSIC,一个覆盖印度法律500多个条文的非专业用户查询语料库。该语料库还包含法院案件判决,以便研究人员有效比较法院与非专业用户数据在LSI任务中的表现。我们对该语料库进行了大量实验,包括对非专业用户数据集进行零样本和少样本推理、检索增强生成和监督式微调基准测试。我们观察到,仅在法院判决上训练的模型在测试非专业用户查询时效果不佳,而从法院数据迁移到非专业用户数据在某些情况下有益。我们还对结果按查询类别和条文频率进行了细粒度分析。

关键词

引用

@article{arxiv.2602.00881,
  title  = {ILSIC: Corpora for Identifying Indian Legal Statutes from Queries by Laypeople},
  author = {Shounak Paul and Raghav Dogra and Pawan Goyal and Saptarshi Ghosh},
  journal= {arXiv preprint arXiv:2602.00881},
  year   = {2026}
}

备注

9 Pages of Main, 1 page of Limitations and Ethics Statement, 11 Pages of Appendix, Accepted for Publication at EACL 2026 (Findings)