中文

MultiLegalPile:一个 689GB 多语言法律语料库

计算与语言 2024-05-21 v3 人工智能 机器学习

摘要

大型高质量数据集对于训练大语言模型(LLMs)至关重要。然而,迄今为止,针对法律等专门关键领域的数据集很少,且现有数据集通常仅面向英语。我们整理并发布了 MultiLegalPile,一个来自 17 个法域、包含 24 种语言的 689GB 语料库。MultiLegalPile 语料库包含具有不同许可的多样法律数据源,允许在合理使用下预训练 NLP 模型,其中 Eurlex Resources 和 Legal mC4 子集具有更宽松的许可。我们在多语言上预训练了两个 RoBERTa 模型和一个 Longformer,并在每个语言特定子集上预训练了 24 个单语模型,并在 LEXTREME 上评估它们。此外,我们在 LexGLUE 上评估了英语和多语言模型。我们的多语言模型在 LEXTREME 上确立了新的 SOTA,我们的英语模型在 LexGLUE 上亦如此。我们以最开放的 possible 许可发布了数据集、训练好的模型以及所有代码。

关键词

引用

@article{arxiv.2306.02069,
  title  = {MultiLegalPile: A 689GB Multilingual Legal Corpus},
  author = {Joel Niklaus and Veton Matoshi and Matthias Stürmer and Ilias Chalkidis and Daniel E. Ho},
  journal= {arXiv preprint arXiv:2306.02069},
  year   = {2024}
}

备注

Accepted to ACL 2024