LeXFiles 与 LegalLAMA:促进英语多国法律语言模型开发
计算与语言
2023-05-24 v2
摘要
在这项工作中,我们对面向法律领域的预训练语言模型(PLM)的性能进行了详细分析。我们考察了它们原始目标、所获得知识与法律语言理解能力之间的相互作用,我们分别将其定义为上游、探测和下游性能。我们不仅将模型规模,也将预训练语料库作为我们研究中的重要维度。为此,我们发布了一个多国英语法律语料库(LeXFiles)和一个法律知识探测基准(LegalLAMA),以促进法律导向 PLM 的训练与详细分析。我们发布了两个在 LeXFiles 上训练的新法律 PLM,并在 LegalLAMA 和 LexGLUE 上与其他模型一起评估。我们发现,探测性能与相关法律主题的上游性能强相关。另一方面,下游性能主要由模型规模与先前的法律知识驱动,而后者可通过上游和探测性能来估计。基于这些发现,我们可以得出结论:对于寻求开发领域特定 PLM 的人而言,两个维度都十分重要。
引用
@article{arxiv.2305.07507,
title = {LeXFiles and LegalLAMA: Facilitating English Multinational Legal Language Model Development},
author = {Ilias Chalkidis and Nicolas Garneau and Catalina Goanta and Daniel Martin Katz and Anders Søgaard},
journal= {arXiv preprint arXiv:2305.07507},
year = {2023}
}
备注
9 pages, long paper at ACL 2023 proceedings