基于提示的法律案件检索有效输入重构
信息检索
2023-09-07 v1
摘要
法律案件检索对于法律从业者根据查询案件有效检索相关案件具有重要作用。大多数现有神经法律案件检索模型直接编码案件的全部法律文本以生成案件表示,然后利用该表示进行最近邻检索。尽管这些直接方法在检索精度上较传统统计方法有所提升,但本文指出了两个显著挑战:(1)法律特征对齐:将整个案件文本作为输入通常会引入冗余和噪声信息,因为从法律角度看,相关案件的判定因素是关键法律特征的对齐而非全文匹配;(2)法律上下文保持:此外,由于现有文本编码模型的输入长度限制通常短于案件文本,需对全文进行截断或分段,导致法律信息全局上下文的丢失。本文提出一种新颖的法律案件检索框架 PromptCase 以应对这些挑战。首先,基于对相关法律视角下相关案件定义的深入研究,将法律事实和法律问题识别并正式定义为促进法律案件检索的关键特征。其次,利用决定性的法律特征,设计了一种基于提示的编码方案以通过语言模型进行有效编码。在两个法律案件检索基准数据集上进行了广泛的零样本实验,证明了所提 PromptCase 的优越检索效果。代码已发布于 https://github.com/yanran-tang/PromptCase。
引用
@article{arxiv.2309.02962,
title = {Prompt-based Effective Input Reformulation for Legal Case Retrieval},
author = {Yanran Tang and Ruihong Qiu and Xue Li},
journal= {arXiv preprint arXiv:2309.02962},
year = {2023}
}