MTEB-NL 与 E5-NL:面向荷兰语的嵌入基准与模型
计算与语言
2025-09-17 v1
摘要
近期,包括模型、基准和数据集在内的嵌入资源已被广泛发布以支持多种语言。然而,荷兰语仍然代表性不足,通常仅占已发布多语言资源的一小部分。为了填补这一空白并鼓励荷兰语嵌入的进一步发展,我们引入了用于其评估和生成的新资源。首先,我们引入了面向荷兰语的大规模文本嵌入基准 (MTEB-NL),它包含现有的荷兰语数据集和新创建的数据集,涵盖了广泛的任务。其次,我们提供了一个由可用荷兰语检索数据集编译而成的训练数据集,并辅以由大语言模型生成的合成数据,以将任务覆盖范围扩展到检索之外。最后,我们发布了一系列 E5-NL 模型,这些模型紧凑而高效,在多项任务中表现出色。我们通过 Hugging Face Hub 和 MTEB 包公开提供我们的资源。
引用
@article{arxiv.2509.12340,
title = {MTEB-NL and E5-NL: Embedding Benchmark and Models for Dutch},
author = {Nikolay Banar and Ehsan Lotfi and Jens Van Nooten and Cristina Arhiliuc and Marija Kliocaite and Walter Daelemans},
journal= {arXiv preprint arXiv:2509.12340},
year = {2025}
}