中文

基于修辞角色的法律文档语义分割

计算与语言 2022-11-08 v2 人工智能 机器学习

摘要

法律文档是非结构化的,使用法律术语且篇幅较长,难以通过常规文本处理技术自动处理。若能将文档分割为连贯的信息单元,法律文档处理系统将获益良多。本文提出一个新的法律文档语料库,其在法律专家协助下标注了一组13个语义连贯单元标签(称为修辞角色),例如事实、论据、成文法、争议点、先例、裁决和判决理由。我们对语料库及标注进行了深入分析。为自动分割法律文档,我们实验了修辞角色预测任务:给定文档,预测对应各角色的文本片段。利用所建语料库,我们广泛实验了多种基于深度学习的基线模型。进一步,我们开发了一种以文档修辞角色标签偏移为辅助任务的多任务学习(MTL)深度模型用于法律文档分割。所提模型表现出优于现有模型的性能。我们还实验了领域迁移下的模型性能及模型蒸馏技术,以考察有限数据条件下的模型表现。

关键词

引用

@article{arxiv.2112.01836,
  title  = {Semantic Segmentation of Legal Documents via Rhetorical Roles},
  author = {Vijit Malik and Rishabh Sanjay and Shouvik Kumar Guha and Angshuman Hazarika and Shubham Nigam and Arnab Bhattacharya and Ashutosh Modi},
  journal= {arXiv preprint arXiv:2112.01836},
  year   = {2022}
}

备注

19 pages, Accepted at Natural Legal Language Processing Workshop, EMNLP 2022