基于深度预训练语言表示模型的无监督法律条文挖掘及其在《意大利民法典》上的应用
计算与语言
2021-12-07 v1 人工智能
信息检索
物理与社会
摘要
将法律检索与搜索建模为预测问题近来已成为法律智能中的主导方法。聚焦于法律条文检索任务,我们提出一个名为 LamBERTa 的深度学习框架,其专为民法典系设计,并特别在《意大利民法典》上训练。据我们所知,这是首个基于 BERT(Bidirectional Encoder Representations from Transformers)学习框架提出面向意大利法律体系的法律条文预测先进方法的研究,该框架近来在深度学习方法中备受关注,并在若干自然语言处理与学习任务中展现出卓越成效。我们通过将意大利语预训练 BERT 在《意大利民法典》或其部分上微调来定义 LamBERTa 模型,以将法律条文检索作为分类任务。我们 LamBERTa 框架的一个关键方面是我们将其构想为解决极端分类场景,其特点为类别数量众多、少样本学习问题,以及缺乏用于意大利法律预测任务的测试查询基准。为解决此类问题,我们定义了不同的无监督法律条文标注方法,原则上可应用于任何法律条文法典系统。我们提供了关于 LamBERTa 模型可解释性与可说明性的洞见,并针对单标签与多标签评估任务,在不同类型查询集上给出了广泛的实验分析。经验证据显示了 LamBERTa 的有效性,以及其相对于广泛使用的深度学习文本分类器与一种为属性感知预测任务设计的少样本学习器的优越性。
引用
@article{arxiv.2112.03033,
title = {Unsupervised Law Article Mining based on Deep Pre-Trained Language Representation Models with Application to the Italian Civil Code},
author = {Andrea Tagarelli and Andrea Simeri},
journal= {arXiv preprint arXiv:2112.03033},
year = {2021}
}