在带有噪声制度性标签的情境下检索语义相似判决:嵌入方法的鲁棒比较
计算与语言
2025-12-08 v1 人工智能
摘要
检索案例法是一项耗时的任务,主要通过查询数据库来完成。我们在三个不同设置下对比两种模型用于捷克宪法法院判决:(i) 大型通用嵌入器(OpenAI),(ii) 在约30,000份判决上使用滑动窗口和注意力池化从头训练的领域特定BERT。我们提出了包括IDF加权关键词重叠作为分级相关性、通过两个阈值(0.20平衡,0.28严格)的二值化、通过配对自助引导的显著性以及以nDCG诊断并支持定性分析的噪声感知评估。尽管绝对nDCG适度(在噪声标签下预期如此),但通用OpenAI嵌入器在两个设置中在@10/@20/@100上均显著优于领域预训练的BERT;差异在统计上显著。诊断将低绝对值归因于标签漂移和强理想,而非效用不足。此外,我们的框架足够稳健,可用于在噪声金数据集上进行评估,这在处理来自遗留司法数据库的异构标签时典型。
引用
@article{arxiv.2512.05681,
title = {Retrieving Semantically Similar Decisions under Noisy Institutional Labels: Robust Comparison of Embedding Methods},
author = {Tereza Novotna and Jakub Harasta},
journal= {arXiv preprint arXiv:2512.05681},
year = {2025}
}
备注
The manuscript has been accepted for presentation as a short paper at the 38th International Conference on Legal Knowledge and Information Systems (JURIX 2025) in Torino, Italy