面向巴西法律搜索的领域自适应稠密检索
信息检索
2026-05-06 v1
摘要
巴西法律检索具有异构性,涵盖判例法、立法和基于问题的搜索。这使得训练稠密检索器成为在更强的领域专业化与跨搜索检索类型的更广鲁棒性之间进行权衡的问题。在本文中,我们利用基于 Qwen3-Embedding-4B 的三种训练设置来探索这一权衡:未经微调的基座模型、仅在法律数据上训练的版本,以及将法律数据与 SQuAD-pt 监督数据集相结合的混合设置。我们在 JU'A 排行榜的五个法律数据集上评估这些模型,并以 Quati 数据集作为额外的葡萄牙语检索基准来测试域外泛化能力。仅法律数据模型在最专业的法律任务上表现最佳。混合设置在保持法律数据上强劲表现的同时,提供了更好的整体平衡,在所有六个数据集上将平均 NDCG@10 从 0.414 提升至 0.447,MRR@10 从 0.586 提升至 0.595,MAP@10 从 0.270 提升至 0.308。最大的改进出现在 Quati 上,其中混合模型明显优于仅法律数据模型。总体而言,结果表明仅法律数据和混合训练带来不同的优势:前者更利于专业化,而后者在不同类型的搜索(尤其是基于问题的搜索)中更具鲁棒性。两个适配后的模型均可在 Hugging Face 上获取。
引用
@article{arxiv.2605.04005,
title = {Domain-Adaptive Dense Retrieval for Brazilian Legal Search},
author = {Jayr Pereira and Roberto Lotufo and Luiz Bonifacio},
journal= {arXiv preprint arXiv:2605.04005},
year = {2026}
}