中文

验证权威性:在多标签判例处理分类基准测试中评估大语言模型

计算与语言 2026-05-19 v1 人工智能

摘要

自动化判例中负面处理的分类是一项关键且细微的 NLP 任务,误分类可能带来重大风险。为解决标准准确率的局限性,本文引入更稳健的评估框架。我们在新的、由专家标注的 239 条真实法律引用数据集上对现代大语言模型进行基准测试,并提出一种新的平均严重性误差指标,以更好地衡量分类错误的实际影响。我们的实验结果显示,性能呈现分化。谷歌的 Gemini 2.5 Flash 在高层次分类任务中取得最高准确率 (79.1%),而 OpenAI 的 GPT-5-mini 在更复杂的细粒度模式上表现最佳 (67.7%)。本工作建立了关键基准、提供了新的情境丰富数据集,并引入了针对这一复杂法律推理任务的评估指标。

关键词

引用

@article{arxiv.2605.17691,
  title  = {Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification},
  author = {M. Mikail Demir and M. Abdullah Canbaz},
  journal= {arXiv preprint arXiv:2605.17691},
  year   = {2026}
}

备注

Accepted for publication at the Natural Legal Language Processing Workshop (NLLP) 2025, co-located with EMNLP