先分段后检索:基于修辞角色的现实法律搜索
计算与语言
2025-08-04 v1 人工智能
信息检索
机器学习
摘要
法律先例检索是普通法体系的基石,由stare decisis原则支配,该原则要求司法决策保持一致性。然而,日益复杂和庞大的法律文档挑战着传统检索方法。TraceRetriever通过镜像实际法律搜索的方式,在有限的案件信息下运行,仅提取修辞上显著的片段,而无需完整文档。我们的管道集成了BM25、向量数据库和Cross-Encoder模型,结合初始结果通过倒数排名融合后进行最终重排序。通过在印度判决上训练的层次BiLSTM CRF分类器生成修辞注释。在IL-PCR和COLIEE 2025数据集上进行评估,TraceRetriever解决了日益增长的文档卷积问题,同时与实际搜索约束相吻合,为先例检索提供可靠且可扩展的基础,增强了在仅有部分案件知识可用的情况下进行法律研究的能力。
引用
@article{arxiv.2508.00679,
title = {Segment First, Retrieve Better: Realistic Legal Search via Rhetorical Role-Based Queries},
author = {Shubham Kumar Nigam and Tanmay Dubey and Noel Shallum and Arnab Bhattacharya},
journal= {arXiv preprint arXiv:2508.00679},
year = {2025}
}