中文

SinhaLegal:用于新德里立法文本信息抽取与分析的基准语料库

计算与语言 2026-03-06 v1

摘要

SinhaLegal 引入了一个约含 200 万词的新德里立法文本语料库,包含 1206 个法律文档。该数据集包含两种类型的法律文档:1065 份1981 年至 2014 年的法律法案和 141 份2010 年至 2014 年的法律提案,这些文件均从官方来源系统收集。文本通过 Google Document AI 进行 OCR 提取,随后进行大量后处理和人工清洗,以确保高质量、可机器读取的内容,每个文档还附有专用元数据文件。对该语料库进行了全面评估,包括语料库统计数据、词汇多样性、词频分析、命名实体识别和主题建模,表明该语料库具有结构化和领域特定的特性。此外,还对使用大型和小型语言模型进行的困惑度分析表明了语言模型对领域特定文本的响应效果。SinhaLegal 语料库是为支持摘要生成、信息抽取和分析等 NLP 任务而设计的关键资源,弥补了新德里法律研究中的关键差距。

关键词

引用

@article{arxiv.2603.04854,
  title  = {SinhaLegal: A Benchmark Corpus for Information Extraction and Analysis in Sinhala Legislative Texts},
  author = {Minduli Lasandi and Nevidu Jayatilleke},
  journal= {arXiv preprint arXiv:2603.04854},
  year   = {2026}
}

备注

18 pages, 8 figures, 18 tables, Accepted paper at the 2nd workshop on Language Models for Low-Resource Languages (LoResLM 2026) @ EACL 2026