中文

法律案件文档相似性:你需要网络与文本两者

信息检索 2022-09-27 v1

摘要

估计两个法律案件文档之间的相似性是一个重要且具有挑战性的问题,具有诸多下游应用,如先例检索与引文推荐。该任务有两类广义方法——基于引文网络的和基于文本的。先前的基于引文网络的方法仅考虑对先例(也称为判例)的引文(PCNet)。该方法遗漏了制定法(司法管辖区的成文法)中固有的重要信号。在本工作中,我们提出 Hier-SPCNet,用制定法的异质网络增强 PCNet。我们将法律文档相似性的领域知识融入 Hier-SPCNet,从而取得基于网络的法律文档相似性的最先进结果。文本与网络相似性都为法律案件相似性提供重要信号;但迄今为止,仅有人尝试平凡地统一这两种信号。在本工作中,我们应用若干方法结合文本与网络信息以估计法律案件相似性。我们在来自印度司法系统的法律案件文档上进行了大量实验,其中文档对之间的黄金标准相似性由来自印度两所知名法学院的法律专家判定。我们的实验确立,与现有的基于网络的法律文档相似性方法相比,我们提出的基于网络的方法显著提升了与领域专家意见的相关性。我们性能最佳的融合方法(结合基于网络与基于文本的相似性)相较最佳基于文本的方法提升了与领域专家意见相关性 11.8%,相较最佳基于网络的方法提升 20.6%。我们还确立,我们性能最佳的方法可用于为源(查询)案件推荐/检索可引且相似的案件,并受到法律专家好评。

关键词

引用

@article{arxiv.2209.12474,
  title  = {Legal Case Document Similarity: You Need Both Network and Text},
  author = {Paheli Bhattacharya and Kripabandhu Ghosh and Arindam Pal and Saptarshi Ghosh},
  journal= {arXiv preprint arXiv:2209.12474},
  year   = {2022}
}

备注

This work has been published in Information Processing and Management, Elsevier, vol. 59, issue 6, November 2022