中文

CaseFacts:面向法律事实核查与判例检索的基准数据集

计算与语言 2026-04-21 v2 机器学习

摘要

自动化事实核查主要聚焦于将一般知识验证于静态语料库,忽视了法律等高风险领域——在此领域中,真理是动态且技术性复杂的。我们介绍 CaseFacts,这是一个用于验证口语化法律主张是否得到美国最高法院判例支持的基准数据集。不同于现有资源将正式文本映射到正式文本,CaseFacts 挑战系统在 layperson assertions 与 technical jurisprudence 之间弥合语义鸿沟,同时考虑时序有效性。该数据集包含 6,294 条主张,归类为 Supported、Refuted 或 Overruled。我们采用多阶段管道,利用大语言模型(LLM)从专家案例摘要中综合生成主张,并采用新颖的语义相似性启发式方法高效识别和验证复杂的法律推翻关系。在最新 LLM 实验中,我们发现该任务仍具挑战性;值得注意的是,使用无限制的网络搜索会降低性能,因而检索到的噪声且非权威的判例会造成干扰。我们发布 CaseFacts 以推动法律事实验证系统的研究发展。

关键词

引用

@article{arxiv.2601.17230,
  title  = {CaseFacts: A Benchmark for Legal Fact-Checking and Precedent Retrieval},
  author = {Akshith Reddy Putta and Jacob Devasier and Chengkai Li},
  journal= {arXiv preprint arXiv:2601.17230},
  year   = {2026}
}