使用合成数据提高越南法律文档检索效果
信息检索
2024-12-03 v1 人工智能
摘要
在法律信息检索领域,有效的基于嵌入的模型对于准确的问答系统至关重要。然而,缺乏大规模标注数据集是一个重大挑战,尤其是针对越南法律文本。为此,我们提出一种新方法,利用大型语言模型生成高质量且多样化的合成查询,用于越南法律段落。该合成数据用于预训练检索模型,具体包括 bi-encoder 和 ColBERT,然后使用挖掘的硬负样本进行对比损失微调。我们的实验表明,这些改进措施导致检索准确性显著提升,验证了在缺乏大规模标注数据集的限制下,合成数据和预训练技术在越南法律领域的有效性。
关键词
引用
@article{arxiv.2412.00657,
title = {Improving Vietnamese Legal Document Retrieval using Synthetic Data},
author = {Son Pham Tien and Hieu Nguyen Doan and An Nguyen Dai and Sang Dinh Viet},
journal= {arXiv preprint arXiv:2412.00657},
year = {2024}
}