利用标注与增强的法案语料库学习法案相似性
计算与语言
2021-09-15 v1
摘要
法案起草是代议制民主的关键要素。然而,常被忽视的是,大多数立法法案都衍生自其他法案,甚至直接复制自其他法案。尽管法案间关联对于理解立法过程具有重要意义,现有方法未能处理法案间的语义相似性,更不用说在法律文书起草中普遍存在的重组或改写现象。本文中,我们克服了这些局限,提出了一项 5 类分类任务,紧密反映法案生成过程的本质。为此,我们构建了一个包含 4,721 个 subsection 级别法案间关系的人工标注数据集,并将该标注数据集发布给研究界。为增强数据集,我们生成了具有不同相似度的合成数据,以模拟复杂的法案起草过程。我们使用 BERT 变体并应用多阶段训练,依次用合成数据与人工标注数据集微调模型。我们发现,当同时使用人工标注与合成数据训练时,预测性能显著提升。最后,我们应用训练好的模型推断 section 级与法案级相似性。我们的分析表明,所提出的方法成功地在多种聚合层级上捕捉了法律文档间的相似性。
引用
@article{arxiv.2109.06527,
title = {Learning Bill Similarity with Annotated and Augmented Corpora of Bills},
author = {Jiseon Kim and Elden Griggs and In Song Kim and Alice Oh},
journal= {arXiv preprint arXiv:2109.06527},
year = {2021}
}
备注
Accepted at EMNLP 2021(Long paper)