中文

AUV:基于单一嵌套码本的音频通用矢量量化教学

音频与语音处理 2025-09-29 v1 声音

摘要

我们提出了 AUV,一种具有单一码本的统一神经音频编解码器,能够实现语音的良好重建,并进一步扩展至包括人声、音乐和声音在内的通用音频。AUV 能够以约 700 bps 的比特率处理任意 16 kHz 混合域音频片段。为实现这一目标,我们使用嵌套的特定领域分区来引导 matryoshka 码本,并分配相应的教师模型进行知识蒸馏,所有这些均在单阶段训练中完成。我们采用以 STFT 特征作为音频表示的 conformer 风格编码器-解码器架构,从而获得更好的音频质量。综合评估表明,AUV 展现出与 SOTA 特定领域单层量化器编解码器相当的音频重建能力,展示了使用单一码本进行音频通用矢量量化的潜力。预训练模型和演示样本可在 https://swivid.github.io/AUV/ 获取。

关键词

引用

@article{arxiv.2509.21968,
  title  = {AUV: Teaching Audio Universal Vector Quantization with Single Nested Codebook},
  author = {Yushen Chen and Kai Hu and Long Zhou and Shulin Feng and Xusheng Yang and Hangting Chen and Xie Chen},
  journal= {arXiv preprint arXiv:2509.21968},
  year   = {2025}
}

备注

Submitted to ICASSP 2026