中文

MUSER:一个多视角相似案例检索数据集

计算与语言 2023-10-25 v1

摘要

相似案例检索(similar case retrieval, SCR)是一种代表性的法律 AI 应用,在促进司法公平方面发挥着关键作用。然而,现有 SCR 数据集在判断案例间相似性时仅关注事实描述部分,忽略了其他有价值的部分(例如法院意见)所能提供的背后洞见性推理过程。此外,案例相似性通常仅由事实描述的文本语义衡量,这可能无法从法律知识的视角捕捉法律案例的全部复杂性。在本工作中,我们提出 MUSER,一个基于多视角相似性度量和带有句子级法律要素标注的综合法律要素的相似案例检索数据集。具体而言,我们选取三个视角(法律事实、争议焦点和法条)并为每个视角构建综合且结构化的法律要素标注模式,以实现准确且具知识性的案例相似性评估。所构建的数据集来源于中国民事案件,包含 100 个查询案例和 4,024 个候选案例。我们在 MUSER 上实现了若干用于法律要素预测的文分类算法和多种用于检索相似案例的检索方法。实验结果表明,融入法律要素可提升 SCR 模型的性能,但仍需进一步努力以应对 MUSER 带来的剩余挑战。源代码与数据集发布于 https://github.com/THUlawtech/MUSER。

关键词

引用

@article{arxiv.2310.15602,
  title  = {MUSER: A Multi-View Similar Case Retrieval Dataset},
  author = {Qingquan Li and Yiran Hu and Feng Yao and Chaojun Xiao and Zhiyuan Liu and Maosong Sun and Weixing Shen},
  journal= {arXiv preprint arXiv:2310.15602},
  year   = {2023}
}

备注

Accepted by CIKM 2023 Resource Track