中文

LawSum:一种用于印度法律文档摘要的弱监督方法

计算与语言 2021-10-26 v3 人工智能 信息检索

摘要

与西方国家的法院不同,印度司法系统的公开记录完全非结构化且含有噪声。迄今为止,不存在大规模公开可用的印度法律文档标注数据集。这限制了法律分析研究的范围。在这项工作中,我们提出了一个新数据集,包含超过10,000份印度最高法院的判决及其对应的手写摘要。所提出的数据集通过规范化常见法律缩写、处理命名实体中的拼写变体、处理错误标点和准确的句子分词进行了预处理。每个句子都标注了其修辞角色。我们还用若干属性标注每份判决,如日期、原告、被告及其代表人的姓名、作出判决的法官、被引用的法案/法规以及用于引用该判决的最常见引文。此外,我们提出了一种自动标注技术,用于识别含有值得摘要信息的句子。我们证明,这种自动标注的数据可有效用于训练具有高准确率的弱监督句子抽取器。除法律文档摘要外,该数据集在检索、引文分析和特定法官判决预测等方面也有潜在应用。

关键词

引用

@article{arxiv.2110.01188,
  title  = {LawSum: A weakly supervised approach for Indian Legal Document Summarization},
  author = {Vedant Parikh and Vidit Mathur and Parth Mehta and Namita Mittal and Prasenjit Majumder},
  journal= {arXiv preprint arXiv:2110.01188},
  year   = {2021}
}