中文

LegalSearchLM:将法律案例检索重新思考为法律要素生成

计算与语言 2025-10-07 v3 信息检索

摘要

法律案例检索(LCR)根据查询案例检索相关案例,是法律专业人员在研究和决策中的基础任务。然而,现有关于 LCR 的研究面临两大局限性。首先,它们在相对小规模的检索语料库(例如 100-55K 个案例)上进行评估,并使用范围较窄的犯罪查询类型,无法充分反映真实法律检索场景的复杂性。其次,它们依赖基于嵌入或词法匹配的方法,常导致表征受限且在法律上不相关的匹配。为解决这些问题,我们提出了:(1)LEGAR BENCH,首个大规模韩语 LCR 基准,涵盖 120 万候选案例中 411 种不同的犯罪查询类型;以及(2)LegalSearchLM,一种对查询案例进行法律要素推理,并通过约束解码以目标案例为基础直接生成包含这些要素内容的检索模型。实验结果表明,LegalSearchLM 在 LEGAR BENCH 上比基线高出 6-20%,实现了最先进的性能。它还展现出对域外案例的强泛化能力,比在域内数据上训练的朴素生成模型高出 15%。

关键词

引用

@article{arxiv.2505.23832,
  title  = {LegalSearchLM: Rethinking Legal Case Retrieval as Legal Elements Generation},
  author = {Chaeeun Kim and Jinu Lee and Wonseok Hwang},
  journal= {arXiv preprint arXiv:2505.23832},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference