中文

KoBLEX:基于多跳推理的开放式法律问答

计算与语言 2025-09-03 v1

摘要

大型语言模型(LLM)在通用领域取得了显著性能,目前正扩展至法律这一专业领域。已有若干基准被提出以评估 LLM 的法律能力。然而,这些基准未能评估开放式且基于条款的问答(QA)。为解决此问题,我们引入了韩国法律可解释问答基准(KoBLEX),旨在评估基于条款的多跳法律推理。KoBLEX 包含 226 个基于场景的 QA 实例及其支持条款,使用混合 LLM-人类专家流水线创建。我们还提出了一种名为参数化条款引导选择检索(ParSeR)的方法,该方法利用 LLM 生成的参数化条款来引导具有法律依据且可靠的答案。ParSeR 通过生成参数化条款并采用三阶段顺序检索过程,促进对复杂法律问题的多跳推理。此外,为了更好地评估生成答案的法律保真度,我们提出了法律保真度评估(LF-Eval)。LF-Eval 是一种联合考虑问题、答案和支持条款的自动指标,与人类判断显示出高度相关性。实验结果表明,ParSeR 始终优于强基线,在多个 LLM 上取得最佳结果。值得注意的是,与使用 GPT-4o 的标准检索相比,ParSeR 的 F1 高出 37.91,LF-Eval 高出 30.81。进一步分析表明,ParSeR 在不同推理深度下均能高效地提供一致性能,消融实验证实了 ParSeR 的有效性。

关键词

引用

@article{arxiv.2509.01324,
  title  = {KoBLEX: Open Legal Question Answering with Multi-hop Reasoning},
  author = {Jihyung Lee and Daehui Kim and Seonjeong Hwang and Hyounghun Kim and Gary Lee},
  journal= {arXiv preprint arXiv:2509.01324},
  year   = {2025}
}

备注

EMNLP 2025 Main Conference