中文

解锁法律知识:瑞士司法摘要的多语言数据集

计算与语言 2025-09-19 v3 人工智能 机器学习

摘要

法律研究依赖于 headnotes:简洁的摘要帮助律师快速识别相关案件。然而,许多法院裁决缺乏 headnotes due to 手动标注成本高昂。为解决这一问题,我们引入了瑞士最高法院裁决摘要 (SLDS) 数据集,包含 20K 份裁决,每个裁决都有德语、法语和意大利语的 headnotes。SLDS 有望显著提升对法律信息的获取,并变革瑞士的法律研究。我们微调开源模型 (Qwen2.5、Llama 3.2、Phi-3.5),并将其与更大的通用-purpose 模型和推理调优 LLM(包括 GPT-4o、Claude 3.5 Sonnet 和开源 DeepSeek R1)进行比较。使用 LLM-as-a-Judge 框架,我们发现微调模型在词汇相似性方面表现良好,而更大的模型在生成更具法律准确性和连贯性的摘要方面更好。有趣的是,推理导向的模型没有表现出一致的优势,这表明在此任务中,事实准确性比深层推理更重要。我们以 CC BY 4.0 许可证发布 SLDS,以支持未来跨语言法律摘要研究。

关键词

引用

@article{arxiv.2410.13456,
  title  = {Unlocking Legal Knowledge: A Multilingual Dataset for Judicial Summarization in Switzerland},
  author = {Luca Rolshoven and Vishvaksenan Rasiah and Srinanda Brügger Bose and Sarah Hostettler and Lara Burkhalter and Matthias Stürmer and Joel Niklaus},
  journal= {arXiv preprint arXiv:2410.13456},
  year   = {2025}
}

备注

Accepted to EMNLP 2025 Findings