巨型法律嵌入基准(MLEB)
计算与语言
2025-10-23 v1 人工智能
信息检索
摘要
我们提出了巨型法律嵌入基准(MLEB),目前为止最大的、最具多样性和最全面的开源法律信息检索基准。MLEB 由十个专家标注的数据集构成,涵盖多个司法辖区(美国、英国、欧盟、澳大利亚、爱尔兰和新加坡)、文档类型(案件、立法、监管指导文件、合同和文献)以及任务类型(检索、零样本分类和问答)。其中七个数据集是全新的构建,以填补开源法律信息检索领域中的领域和司法辖区空白。我们记录了构建 MLEB 及创建新组成数据集的方法学,并公开释放代码、结果和数据,以助力可重复评估。
引用
@article{arxiv.2510.19365,
title = {The Massive Legal Embedding Benchmark (MLEB)},
author = {Umar Butler and Abdur-Rahman Butler and Adrian Lucas Malec},
journal= {arXiv preprint arXiv:2510.19365},
year = {2025}
}
备注
15 pages, 2 figures