Gavel:代理人遇上检查表评估 LLM 在长上下文法律摘要方面的能力
计算与语言
2026-01-09 v1
摘要
大型语言模型(LLMs)现在支持最高达 100 万 token 的上下文,但其在复杂长上下文任务上的有效性仍不明确。本文研究了多文档法律案件摘要任务,其中单个案件常跨越多份文档,总计 10 万至 50 万 token。我们引入 Gavel-Ref,一个基于参考的评估框架,包含 26 项多价值检查表评估,以及残差事实和写作风格评估。使用 Gavel-Ref,我们超越了先前工作报告的单一综合分数,系统评估了 12 个前沿 LLM 在 100 份来自 2025 年的法律案件上的表现,案件上下文长度从 32K 到 512K token 不等。我们的结果表明,即便是最强大的模型 Gemini 2.5 Pro,也仅实现约 50 分 ,凸显了该任务的难度。模型在简单检查表项目(如案件提交日期)上表现良好,但在多价值或罕见项目(如和解协议和监督报告)上表现较差。随着 LLM 持续改进,可能在未来超越人类编写的摘要,这会使人类参考资料变得不够可靠——因此我们开发了 Gavel-Agent,一个高效且自主的代理人框架,为 LLM 提供六项工具,以直接从案件文件中提取检查表。使用 Qwen3,Gavel-Agent 将 token 使用量降低 36%,而 仅下降 7%,这与使用 GPT-4.1 进行端到端提取相比。
引用
@article{arxiv.2601.04424,
title = {Gavel: Agent Meets Checklist for Evaluating LLMs on Long-Context Legal Summarization},
author = {Yao Dou and Wei Xu},
journal= {arXiv preprint arXiv:2601.04424},
year = {2026}
}
备注
webpage at https://yao-dou.github.io/gavel/