解锁法律知识:瑞士司法摘要的多语言数据集
计算与语言
2025-09-19 v3 人工智能
机器学习
摘要
法律研究依赖于 headnotes:简洁的摘要帮助律师快速识别相关案件。然而,许多法院裁决缺乏 headnotes due to 手动标注成本高昂。为解决这一问题,我们引入了瑞士最高法院裁决摘要 (SLDS) 数据集,包含 20K 份裁决,每个裁决都有德语、法语和意大利语的 headnotes。SLDS 有望显著提升对法律信息的获取,并变革瑞士的法律研究。我们微调开源模型 (Qwen2.5、Llama 3.2、Phi-3.5),并将其与更大的通用-purpose 模型和推理调优 LLM(包括 GPT-4o、Claude 3.5 Sonnet 和开源 DeepSeek R1)进行比较。使用 LLM-as-a-Judge 框架,我们发现微调模型在词汇相似性方面表现良好,而更大的模型在生成更具法律准确性和连贯性的摘要方面更好。有趣的是,推理导向的模型没有表现出一致的优势,这表明在此任务中,事实准确性比深层推理更重要。我们以 CC BY 4.0 许可证发布 SLDS,以支持未来跨语言法律摘要研究。
引用
@article{arxiv.2410.13456,
title = {Unlocking Legal Knowledge: A Multilingual Dataset for Judicial Summarization in Switzerland},
author = {Luca Rolshoven and Vishvaksenan Rasiah and Srinanda Brügger Bose and Sarah Hostettler and Lara Burkhalter and Matthias Stürmer and Joel Niklaus},
journal= {arXiv preprint arXiv:2410.13456},
year = {2025}
}
备注
Accepted to EMNLP 2025 Findings