中文

CaseEncoder:一种用于法律案件编码的知识增强预训练模型

信息检索 2023-05-10 v1 计算与语言

摘要

法律案件检索是现代法律信息系统中的关键环节。尽管近期研究已利用基于通用领域自监督预训练范式的预训练语言模型(PLMs)来构建法律案件检索模型,但使用通用领域 PLM 作为骨干网络存在局限性。具体而言,这些模型可能无法充分捕获法律案件文档中潜在的法律特征。为解决此问题,我们提出 CaseEncoder,一种在法律案件文档编码的数据采样与预训练阶段均利用细粒度法律知识的法律文档编码器。在数据采样阶段,我们利用细粒度法条信息来引导正例与负例的选择,从而提升训练数据质量。在预训练阶段,我们设计与相关法律案件判定标准相对齐的法律特定预训练任务。基于这些任务,我们引入一种称为偏置圆损失(Biased Circle Loss)的创新损失函数,以增强模型在细粒度上识别案件相关性的能力。在多个基准上的实验结果表明,CaseEncoder 在零样本法律案件检索中显著优于现有的通用预训练模型与法律特定预训练模型。

关键词

引用

@article{arxiv.2305.05393,
  title  = {CaseEncoder: A Knowledge-enhanced Pre-trained Model for Legal Case Encoding},
  author = {Yixiao Ma and Yueyue Wu and Weihang Su and Qingyao Ai and Yiqun Liu},
  journal= {arXiv preprint arXiv:2305.05393},
  year   = {2023}
}

备注

5 pages