中文

CaseSumm:来自美国最高法院意见的大规模长上下文摘要数据集

计算与语言 2025-01-03 v1 人工智能 计算机与社会 机器学习

摘要

本文介绍了CaseSumm,一个用于法律领域长上下文摘要的新数据集,以满足对更长、更复杂数据集进行摘要评估的需求。我们收集了25.6K份美国最高法院(SCOTUS)意见及其官方摘要(称为“syllabuses”)。我们的数据集是最大的开放法律案例摘要数据集,并且是第一个包含可追溯到1815年的SCOTUS裁决摘要的数据集。我们还使用自动指标和专家人工评估对LLM生成的摘要进行了全面评估,揭示了这些评估方法之间的差异。我们的评估显示,较小的开源模型Mistral 7b在大多数自动指标上优于较大的模型,并成功生成了类似syllabus的摘要。相比之下,人类专家注释者指出Mistral摘要包含幻觉。注释者一致认为GPT-4摘要更清晰,并表现出更高的敏感性和特异性。此外,我们发现基于LLM的评估与人类评估的相关性并不比传统自动指标更高。此外,我们的分析识别了生成摘要中的特定幻觉,包括先例引用错误和案件事实的误述。这些发现证明了当前法律摘要自动评估方法的局限性,并强调了人工评估在评估摘要质量中的关键作用,特别是在复杂、高风险领域。CaseSumm可在https://huggingface.co/datasets/ChicagoHAI/CaseSumm获取。

关键词

引用

@article{arxiv.2501.00097,
  title  = {CaseSumm: A Large-Scale Dataset for Long-Context Summarization from U.S. Supreme Court Opinions},
  author = {Mourad Heddaya and Kyle MacMillan and Anup Malani and Hongyuan Mei and Chenhao Tan},
  journal= {arXiv preprint arXiv:2501.00097},
  year   = {2025}
}