中文

用于日本法律文本检索的自适应两阶段微调 LLMs

信息检索 2024-12-19 v1 计算与语言 机器学习

摘要

文本检索涉及从大型存储库中查找并检索与用户查询相关的基于文本的内容,在法律文件检索等现实场景中具有应用。尽管大多数现有研究关注英语,但针对日语语境的工作有限。在本文中,我们引入了一个专门为日本法律语境设计的新数据集,并提出了一种针对该领域定制的新颖两阶段流水线。在第一阶段,模型学习对全局语境的广泛理解,增强其对多样化查询的泛化能力和适应性。在第二阶段,对模型进行微调以处理法律场景特有的复杂查询。我们进行了广泛的实验以证明该方法的卓越性能,其表现优于现有基线。此外,我们的流水线在英语语境中被证明是有效的,在 MS MARCO 数据集上超越了可比基线。我们已在 GitHub 上公开了代码,并可通过 HuggingFace 访问模型检查点。

关键词

引用

@article{arxiv.2412.13205,
  title  = {Adaptive Two-Phase Finetuning LLMs for Japanese Legal Text Retrieval},
  author = {Quang Hoang Trung and Nguyen Van Hoang Phuc and Le Trung Hoang and Quang Huu Hieu and Vo Nguyen Le Duy},
  journal= {arXiv preprint arXiv:2412.13205},
  year   = {2024}
}