一部法律,多种语言:面向司法支持的多语言法律推理基准评测
计算与语言
2024-08-22 v3 人工智能
机器学习
摘要
大语言模型(LLMs)近来的进展已使许多自然语言处理(NLP)基准趋于饱和,凸显出需要更具挑战性的基准以恰当评估 LLM 能力。然而,领域特定与多语言基准十分稀少,因其开发需要深入的专业知识。此外,大多数公开模型主要在英语语料上训练,而其他语言研究不足,尤其对于实际领域特定的 NLP 任务。本工作中,我们引入一个法律领域的新颖 NLP 基准,从五个关键维度挑战 LLM:处理\emph{长文档}(至多 50K tokens)、运用\emph{领域特定知识}(体现于法律文本中)、\emph{多语言}理解(覆盖五种语言)、\emph{多任务}(包含法律文档到文档的信息检索、法庭观点生成、主导判决摘要、引文抽取及八项具挑战性的文本分类任务)以及\emph{推理}(尤其包含法庭观点生成,亦含文本分类任务)。我们的基准包含来自瑞士法律体系的多类数据集,得以对 underlying 非英语、天然多语言的法律体系进行全面研究。尽管我们的数据集规模庞大(部分含数十万样例),现有公开多语言模型在多数任务上仍表现不佳,即便经过广泛的领域内预训练与微调。我们以宽松的开放 CC BY-SA 许可发布所有资源(基准套件、预训练模型、代码)。
引用
@article{arxiv.2306.09237,
title = {One Law, Many Languages: Benchmarking Multilingual Legal Reasoning for Judicial Support},
author = {Ronja Stern and Vishvaksenan Rasiah and Veton Matoshi and Srinanda Brügger Bose and Matthias Stürmer and Ilias Chalkidis and Daniel E. Ho and Joel Niklaus},
journal= {arXiv preprint arXiv:2306.09237},
year = {2024}
}