CLaw:大语言模型中文法律知识基准——细粒度语料库与推理分析
计算与语言
2025-09-26 v1
摘要
大语言模型(LLM)日益被任务分析法律文本并引用相关法规,但由于通用预训练会无专注地摄取法律文本,其法律知识的真实深度往往被掩盖。本文引入CLaw,一个专为细致评估LLM在中文法律知识及其应用推理而设计的基准。CLaw包含两个关键组件:(1)涵盖全部306部中国国家法规的、细粒度的语料库,按次分段并包含精确的历史修订时间步,用于严格的召回评估(64,849条);(2)从中国最高法院精选材料中衍生的254个基于案例的推理实例,用于评估法律知识的实际应用。我们的实证评估显示,大多数当代LLM在忠实再现法律条文方面存在显著困难。由于准确的召回和引用法律条文是法律推理的基础,这一不足严重削弱了其响应的可靠性。我们认为,要实现LLM可信的法律推理,需要准确的知识召回——可能通过监督微调(SFT)或检索增强生成(RAG)来增强——与强大的通用推理能力之间的健全协同作用。这一工作为推进领域特定LLM推理,特别是在复杂的法律领域,提供了必要的基准和关键见解。
引用
@article{arxiv.2509.21208,
title = {CLaw: Benchmarking Chinese Legal Knowledge in Large Language Models - A Fine-grained Corpus and Reasoning Analysis},
author = {Xinzhe Xu and Liang Zhao and Hongshen Xu and Chen Chen},
journal= {arXiv preprint arXiv:2509.21208},
year = {2025}
}