中文

LEXTREME: 面向法律领域的多语言多任务基准

计算与语言 2024-01-09 v3 人工智能 机器学习

摘要

近来,在 transformer 架构惊人进展的推动下,法律 NLP 领域经历了爆发式增长。为衡量进展,精心构建且具有挑战性的基准至关重要。然而,大多数基准仅支持英语,而在法律 NLP 领域尤其尚无多语言基准可用。此外,许多基准已趋于饱和,最优模型明显超越最优人类表现并取得近乎完美的分数。我们调研了法律 NLP 文献,筛选出覆盖 24 种语言的 11 个数据集,构建了 LEXTREME。为提供公平比较,我们提出两种聚合分数,一种基于数据集,一种基于语言。最优基线(XLM-R large)在数据集聚合分数和语言聚合分数上均取得 61.3。这表明 LEXTREME 仍极具挑战性,并留有充分的改进空间。为方便研究人员与从业者使用,我们在 huggingface 上发布了 LEXTREME 以及评估模型所需的全部代码,并提供了一个包含所有运行记录的公开 Weights and Biases 项目。

关键词

引用

@article{arxiv.2301.13126,
  title  = {LEXTREME: A Multi-Lingual and Multi-Task Benchmark for the Legal Domain},
  author = {Joel Niklaus and Veton Matoshi and Pooja Rani and Andrea Galassi and Matthias Stürmer and Ilias Chalkidis},
  journal= {arXiv preprint arXiv:2301.13126},
  year   = {2024}
}

备注

Published at EMNLP Findings 2023