中文

在大型声音嵌入基准(MSEB)上对 LLM 的评测

声音 2026-05-07 v1 机器学习

摘要

大型声音嵌入基准(MSEB)已成为评估音频模型功能广度的标准。虽然最初的基线专注于专用编码器,但向“原生音频”大型语言模型(LLM)的转变暗示了一种新范式,即单一的多模态主干网络可能取代复杂的、特定任务的流水线。本文对领先的 LLM——包括 Gemini 和 GPT 系列的成员——在八项核心 MSEB 能力上进行了严格的实证评估,以评估其有效性和音频-文本对等性。我们的结果表明,尽管在性能和鲁棒性方面仍存在显著的模态差距,但关于“最优”建模方法的实证证据仍无定论。最终,在原生音频和级联架构之间的选择在很大程度上取决于特定的用例需求以及关于延迟、成本和推理深度的基本假设。

关键词

引用

@article{arxiv.2605.04556,
  title  = {Benchmarking LLMs on the Massive Sound Embedding Benchmark (MSEB)},
  author = {Cyril Allauzen and Tom Bagby and Georg Heigold and Ehsan Variani and Ke Wu},
  journal= {arXiv preprint arXiv:2605.04556},
  year   = {2026}
}