中文

LawInstruct:用于研究语言模型适应法律领域的资源

计算与语言 2025-01-24 v2 人工智能 机器学习

摘要

指令微调是使语言模型能够直接用于用户交互的重要步骤。然而,法律领域在典型指令数据集中代表性不足(例如,在 Super-NaturalInstructions 的 1600 多个任务中仅有 10 个)。为了研究在法律数据集上进行指令微调是否是实现强大法律推理的必要条件,我们聚合了 58 个带标注的法律数据集并为每个数据集编写了指令,创建了 LawInstruct。LawInstruct 覆盖 17 个全球司法管辖区、24 种语言,包含总计 1200 万个跨多种任务(如法律问答、法庭案件摘要和法律论点挖掘)的样本。我们在 LegalBench 上评估我们的模型,在 162 个具有挑战性且贴近现实的法律任务中衡量 5 个类别的法律推理能力,并在 MMLU 上评估以衡量通用推理能力的潜在下降。我们发现,在 Flan-T5 上进行特定于法律的指令微调(得到 FLawN-T5)提升了所有模型规模在 LegalBench 上的性能,对于基础规模而言,总体提升了 15 个百分点或 50%。没有任何模型规模在 MMLU 上表现出性能下降。我们发布 LawInstruct 作为进一步研究法律领域指令微调的资源。

关键词

引用

@article{arxiv.2404.02127,
  title  = {LawInstruct: A Resource for Studying Language Model Adaptation to the Legal Domain},
  author = {Joel Niklaus and Lucia Zheng and Arya D. McCarthy and Christopher Hahn and Brian M. Rosen and Peter Henderson and Daniel E. Ho and Garrett Honke and Percy Liang and Christopher Manning},
  journal= {arXiv preprint arXiv:2404.02127},
  year   = {2025}
}

备注

Accepted at Findings of NAACL 2025