中文

面向生成式音频的评估:来自神经音频编解码器嵌入距离的启示

音频与语音处理 2026-01-23 v2

摘要

神经音频编解码器(NACs)通过学习紧凑的音频表示实现低码率压缩,这些表示也可作为感知质量评估的特征。我们提出了 DACe,这是 Descript Audio Codec (DAC) 的增强高保真版本,在多样且平衡采样的真实与合成音调数据上训练而成。我们在涵盖语音、音乐和混合内容的 MUSHRA 测试中,系统比较了 Fréchet Audio Distance (FAD) 和 Maximum Mean Discrepancy (MMD)。FAD 始终优于 MMD,且来自更高保真度 NACs(如 DACe)的嵌入与人类判断表现出更强的相关性。尽管 CLAP LAION Music (CLAP-M) 和 OpenL3 Mel128 (OpenL3-128M) 嵌入实现了更高的相关性,但 NAC 嵌入为音频质量评估提供了一种实用的零样本方法,仅需未编码音频进行训练。这些结果证明了 NACs 在压缩和感知驱动的音频评估方面的双重效用。

关键词

引用

@article{arxiv.2509.18823,
  title  = {Towards Evaluating Generative Audio: Insights from Neural Audio Codec Embedding Distances},
  author = {Arijit Biswas and Lars Villemoes},
  journal= {arXiv preprint arXiv:2509.18823},
  year   = {2026}
}

备注

Accepted to 51st IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 04-08 May 2026