中文

巨型法律嵌入基准(MLEB)

计算与语言 2025-10-23 v1 人工智能 信息检索

摘要

我们提出了巨型法律嵌入基准(MLEB),目前为止最大的、最具多样性和最全面的开源法律信息检索基准。MLEB 由十个专家标注的数据集构成,涵盖多个司法辖区(美国、英国、欧盟、澳大利亚、爱尔兰和新加坡)、文档类型(案件、立法、监管指导文件、合同和文献)以及任务类型(检索、零样本分类和问答)。其中七个数据集是全新的构建,以填补开源法律信息检索领域中的领域和司法辖区空白。我们记录了构建 MLEB 及创建新组成数据集的方法学,并公开释放代码、结果和数据,以助力可重复评估。

关键词

引用

@article{arxiv.2510.19365,
  title  = {The Massive Legal Embedding Benchmark (MLEB)},
  author = {Umar Butler and Abdur-Rahman Butler and Adrian Lucas Malec},
  journal= {arXiv preprint arXiv:2510.19365},
  year   = {2025}
}

备注

15 pages, 2 figures