面向先例检索的 LLM 嵌入器
群论
2025-07-25 v1
摘要
在普通法体系中,律师和法官等法律专业人士依赖先例来构建论点。随着案件数量在历史上快速增长,有效检索先例已成为必需。先例检索(PCR)是一种信息检索(IR)任务,旨在从大量候选案件中自动识别特定查询的最相关案件。尽管 IR 方法在过去几年经历了数个范式变迁,但 PCR 方法的绝大多数仍依赖传统 IR 方法,如 BM25。最新的深度学习 IR 方法在 PCR 中未取得成功,主要受两大挑战制约:i. 法律文本长度限制;使用强大的 BERT-based transformer 模型时,输入文本长度有限,必然要求通过截断或分割方式缩短输入,导致法律上下文信息丢失。ii. 缺乏法律训练数据;由于数据隐私 concerns,可用的 PCR 数据集常规模有限,难以有效训练深度学习模型。为此,本文通过利用 LLM-based 文本嵌入器来解决上述挑战。LLM-based 嵌入器支持更长的输入长度,且我们以无监督方式使用它们,无需训练数据,从而同时解决了上述两个问题。本文评估了四个 PCR 基准数据集中最新的 LLM-based 文本嵌入器,结果表明它们超越了 BM25 和监督式 transformer 模型。
引用
@article{arxiv.2507.18456,
title = {Determinant for automorphisms of semidirect product of groups},
author = {Ratan Lal and Alka Choudhary and Vipul Kakkar},
journal= {arXiv preprint arXiv:2507.18456},
year = {2025}
}
备注
This is a first draft. Comments welcome