中文

MAEB:大型音频嵌入基准

声音 2026-02-19 v1 人工智能 计算与语言 机器学习

摘要

我们介绍了大型音频嵌入基准(MAEB),覆盖语音、音乐、环境声以及跨模态音频-文本推理中的30个任务,支持100多个语言。我们评估了50多个模型,发现没有单个模型在所有任务中都占据统治地位:对比音频-文本模型在环境声分类(如ESC50)中表现突出,但在多语言语音任务(如SIB-FLEURS)上得分接近随机,而语音预训练模型则表现相反。聚类对所有模型都具有挑战性,即使是表现最好的模型也仅取得有限的成果。我们观察到,擅长声学理解的模型往往在语言任务中表现不佳,反之亦然。我们还展示了音频编码器在MAEB上的表现与其在音频大型语言模型中使用的表现高度相关。MAEB源自MAEB+,包含98个任务。MAEB旨在保持任务多样性的同时降低评估成本,并集成到MTEB生态系统中,用于在文本、图像和音频模态中进行统一评估。我们发布MAEB和所有98个任务 along with code and leaderboard at https://github.com/embeddings-benchmark/mteb。

关键词

引用

@article{arxiv.2602.16008,
  title  = {MAEB: Massive Audio Embedding Benchmark},
  author = {Adnan El Assadi and Isaac Chung and Chenghao Xiao and Roman Solomatin and Animesh Jha and Rahul Chand and Silky Singh and Kaitlyn Wang and Ali Sartaz Khan and Marc Moussa Nasser and Sufen Fong and Pengfei He and Alan Xiao and Ayush Sunil Munot and Aditya Shrivastava and Artem Gazizov and Niklas Muennighoff and Kenneth Enevoldsen},
  journal= {arXiv preprint arXiv:2602.16008},
  year   = {2026}
}