AfriMTEB 与 AfriE5:非洲语言文本嵌入模型基准测试与适配
计算与语言
2026-03-09 v2
摘要
文本嵌入是几项 NLP 任务的 essential 构建模块,例如检索增强生成,这对于防止 LLM 中的幻觉至关重要。尽管近期发布了大规模多语言 MTEB (MMTEB),但非洲语言仍严重缺乏代表性,现有任务常常是从翻译基准(如 FLORES 聚类或 SIB-200)中 repurposed 的。本文引入 AfriMTEB——MMTEB 的一个区域扩展,覆盖 59 种语言、14 项任务和 38 个数据集,其中包括 6 个全新的数据集。与许多 MMTEB 数据集包含 fewer than 5 种语言不同,新的添加涵盖 14 至 56 种非洲语言,并引入全新的任务,如仇恨言论检测、意图检测和情感分类,以前未覆盖。配套地,我们 presented AfriE5,这是一种通过跨语言对比蒸馏将 instruction-tuned mE5 模型适配到非洲语言的技术。我们的评估显示,AfriE5 实现了最先进的性能,超越了像 Gemini-Embeddings 和 mE5 等强大基线。
引用
@article{arxiv.2510.23896,
title = {AfriMTEB and AfriE5: Benchmarking and Adapting Text Embedding Models for African Languages},
author = {Kosei Uemura and Miaoran Zhang and David Ifeoluwa Adelani},
journal= {arXiv preprint arXiv:2510.23896},
year = {2026}
}
备注
Accepted to EACL 2026 (main conference)