预训练何时有用?评估法律领域的自监督学习与 CaseHOLD 数据集
计算与语言
2021-07-07 v3
摘要
尽管自监督学习在自然语言处理中取得了快速进展,但研究人员何时应当进行资源密集型的领域特定预训练(领域预训练)仍不清楚。令人困惑的是,尽管法律语言被广泛认为独具特色,法律领域却鲜有文献记载领域预训练带来实质性收益的例子。我们假设,这些现有结果源于现有法律 NLP 任务过于简单,未能满足领域预训练可提供帮助的条件。为此,我们首先提出 CaseHOLD(Case Holdings On Legal Decisions),这是一个由超过 53,000 道多选题组成的新数据集,用于识别所引案例的相关裁判要旨。该数据集对律师而言是一项基础任务,并且从 NLP 角度看既具有法律意义又困难(BiLSTM 基线的 F1 为 0.4)。其次,我们评估在 CaseHOLD 和现有法律 NLP 数据集上的性能提升。虽然基于通用语料(Google Books 和 Wikipedia)预训练的 Transformer 架构(BERT)提升了性能,但使用约 350 万份美国所有法院判决(规模大于 BERT 的语料)并配备自定义法律词汇的领域预训练,在 CaseHOLD 上表现出最显著的性能提升(F1 提升 7.2%,相当于 BERT 上 12% 的改进),并在其他两个法律任务上带来一致的性能提升。第三,我们表明,当任务与预训练语料表现出充分相似性时,领域预训练可能是合理的:三个法律任务中的性能提升水平与任务的领域特异性直接相关。我们的发现说明了研究人员何时应当进行资源密集型预训练,并表明基于 Transformer 的架构同样学习到了暗示独特法律语言的嵌入。
引用
@article{arxiv.2104.08671,
title = {When Does Pretraining Help? Assessing Self-Supervised Learning for Law and the CaseHOLD Dataset},
author = {Lucia Zheng and Neel Guha and Brandon R. Anderson and Peter Henderson and Daniel E. Ho},
journal= {arXiv preprint arXiv:2104.08671},
year = {2021}
}
备注
ICAIL 2021. Code & data available at https://github.com/reglab/casehold