中文

AudioCodecBench:用于音频编解码器评估的全面基准

声音 2025-09-05 v2 人工智能 机器学习

摘要

多模态大语言模型(MLLMs)在语音和音乐领域得到广泛应用。这一趋势导致对大模型(LMs)的音频标记化获得了关注。与仅捕获语义内容的文本标记不同,音频标记必须同时捕获全局语义内容并保留细粒度的声学细节。此外,它们提供一种离散方法,可有效集成到 MLLMs 中。然而,现有研究不适用于语义标记和声学标记的定义。此外,不同编解码器的评估通常集中在特定领域或任务上,如重建或自动语音识别(ASR)任务,这会阻碍公平且全面的比较。为此,本文提供了适当的语义标记和声学标记的定义,并引入了系统化的评估框架。该框架允许对编解码器能力进行全面评估,评估四个维度:音频重建指标、codebook index(ID)稳定性、decoder-only transformer perplexity 以及下游探测任务的性能。我们的结果表明,所提供的适当定义是正确的,以及重建指标、codebook ID 稳定性、下游探测任务和 perplexity 之间的相关性。

关键词

引用

@article{arxiv.2509.02349,
  title  = {AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation},
  author = {Lu Wang and Hao Chen and Siyu Wu and Zhiyue Wu and Hao Zhou and Chengfeng Zhang and Ting Wang and Haodi Zhang},
  journal= {arXiv preprint arXiv:2509.02349},
  year   = {2025}
}