LEMUR:面向多语言法律嵌入模型鲁棒微调的语料库
计算与语言
2026-02-11 v1 人工智能
信息检索
摘要
大型语言模型 (LLM) 正在增加用于法律信息检索的使用,但其在多语言法律环境中的部署受到不可靠检索和缺乏领域适应的开放嵌入模型的限制。特别是,现有的多语言法律语料库不用于语义检索,PDF 基于立法的来源由于文本提取不完美引入了大量噪声。为解决这些挑战,我们引入 LEMUR,这是一个由 24,953 份官方 EUR-Lex PDF 文档构成的大规模多语言环境立法语料库,覆盖 25 种语言。我们通过测量其对权威 HTML 版本的词汇一致性来量化 PDF 到文本转换的忠诚度,使用词汇内容得分 (LCS)。在 LEMUR 基础上,我们使用对比目标在单语和双语设置中对三种最先进的多语言嵌入模型进行微调,反映真实的法律检索情景。实验在低资源和高资源语言上表明,法律领域微调始终显著提高 Top-k 检索准确率,尤其在低资源语言上效果尤为显著。跨语言评估显示,这些改进可传递到未见语言,表明微调主要增强了语言无关的内容级法律表征,而非语言特定线索。我们发布代码\footnote{\href{https://github.com/nargesbh/eur_lex}{GitHub Repository}} 和数据\footnote{\href{https://huggingface.co/datasets/G4KMU/LEMUR}{Hugging Face Dataset}}。
引用
@article{arxiv.2602.09570,
title = {LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval},
author = {Narges Baba Ahmadi and Jan Strich and Martin Semmann and Chris Biemann},
journal= {arXiv preprint arXiv:2602.09570},
year = {2026}
}
备注
Accepted at EACL SRW 26