中文

LeCoDe:面向交互式法律咨询对话评估的基准数据集

计算与语言 2025-10-24 v2 人工智能

摘要

法律咨询对于保障个人权利和确保获得司法公正至关重要,但由于专业人员的短缺,对许多人来说仍然成本高昂且难以获得。尽管大型语言模型(LLMs)的最新进展为可扩展、低成本的 法律援助提供了有希望的途径,但当前的系统在处理真实世界咨询的交互性和知识密集型特征方面仍存在不足。为了应对这些挑战,我们引入了LeCoDe,一个真实世界的多轮基准数据集,包含3,696个法律咨询对话和110,008个对话轮次,旨在评估和改进LLMs的法律咨询能力。借助LeCoDe,我们创新地从短视频平台收集直播咨询,提供真实的法律多轮咨询对话。法律专家的严格标注进一步用专业见解和专长增强了该数据集。此外,我们提出了一个综合评估框架,从(1)澄清能力和(2)专业建议质量两个方面评估LLMs的咨询能力。该统一框架在两个维度上纳入了12个指标。通过对各种通用和特定领域LLMs的广泛实验,我们的结果揭示了该任务面临的重大挑战,即使是像GPT-4这样的最先进模型,在澄清方面也仅达到39.8%的召回率,在建议质量方面的总体得分为59%,突显了专业咨询场景的复杂性。基于这些发现,我们进一步探索了几种增强LLMs法律咨询能力的策略。我们的基准有助于推进法律领域对话系统的研究,特别是在模拟更真实的用户与专家交互方面。

关键词

引用

@article{arxiv.2505.19667,
  title  = {LeCoDe: A Benchmark Dataset for Interactive Legal Consultation Dialogue Evaluation},
  author = {Weikang Yuan and Kaisong Song and Zhuoren Jiang and Junjie Cao and Yujie Zhang and Jun Lin and Kun Kuang and Ji Zhang and Xiaozhong Liu},
  journal= {arXiv preprint arXiv:2505.19667},
  year   = {2025}
}