LexGLUE:一个用于英语法律语言理解的基准数据集
计算与语言
2022-11-09 v4
摘要
法律及其解释、法律论证与协议通常以书面形式表达,导致产生大量的法律文本语料。作为法律实践核心的这类文本分析,随着语料规模增长变得愈发繁复。自然语言理解(NLU)技术可作为支持法律从业者的宝贵工具。然而,其实用性在很大程度上取决于当前 SOTA 模型能否跨法律领域各类任务进行泛化。为回答这一当前开放问题,我们引入了法律通用语言理解评测(LexGLUE)基准,这是一个以标准化方式评估模型在多样化法律 NLU 任务上性能的数据集集合。我们还对若干通用模型与法律导向模型进行了评估和分析,表明后者在多个任务上持续提供性能改进。
引用
@article{arxiv.2110.00976,
title = {LexGLUE: A Benchmark Dataset for Legal Language Understanding in English},
author = {Ilias Chalkidis and Abhik Jana and Dirk Hartung and Michael Bommarito and Ion Androutsopoulos and Daniel Martin Katz and Nikolaos Aletras},
journal= {arXiv preprint arXiv:2110.00976},
year = {2022}
}
备注
9 pages, long paper at ACL 2022 proceedings. LexGLUE benchmark is available at: https://huggingface.co/datasets/lex_glue. Code is available at: https://github.com/coastalcph/lex-glue. Update TFIDF-SVM scores in the last version