大规模声音嵌入基准 (Massive Sound Embedding Benchmark)
声音
2026-02-10 v1 计算与语言
摘要
音频是多模态感知的关键组成部分,任何真正智能的系统都必须展示出广泛的听觉能力。这些能力包括转录、分类、检索、推理、分割、聚类、重新排序和重建。从根本上说,每个任务都涉及将原始音频信号转换为有意义的'嵌入'——无论是单个向量、连续或离散表示序列,或其他结构形式——该嵌入随后作为生成任务最终响应的基础。在推进稳健机器听觉智能方面,我们提出了大规模声音嵌入基准 (Massive Sound Embedding Benchmark, MSEB):一个可扩展的框架,用于评估任何多模态系统的听觉组件。在其首次发布中,MSEB 提供了八个核心任务的全面套组,未来计划增加更多任务,支持多样化数据集,包括全新的大规模简单语音问题 (Simple Voice Questions, SVQ) 数据集。我们的初始实验建立了清晰的性能空间,突显了在音频作为核心信号的实际多模态体验中显著提升的机遇。我们鼓励研究社区使用 MSEB 来评估他们的算法并推动其发展。该库已公开托管于 github。
引用
@article{arxiv.2602.07143,
title = {Massive Sound Embedding Benchmark (MSEB)},
author = {Georg Heigold and Ehsan Variani and Tom Bagby and Cyril Allauzen and Ji Ma and Shankar Kumar and Michael Riley},
journal= {arXiv preprint arXiv:2602.07143},
year = {2026}
}