中文

SwitchCodec:面向高保真神经音频编码的自适应残差专家稀疏量化

声音 2026-05-08 v2 人工智能

摘要

最近的神经音频压缩模型通常依赖残差向量量化实现高保真编码,但固定的每帧代码book数量对音频内容的广泛变异尤其是简单或高度复杂信号而言并不优化。 为了解决这一局限,我们提出 SwitchCodec,一种基于残差专家向量量化(REVQ)的神经音频 codec。 REVQ 将共享量化器与根据输入音频动态路由的专家量化器相结合,根据输入音频激活不同的专家量化器,使比特率与代码book 容量分离,提高了压缩效率。 这种设计确保了每个量化器的完整训练和利用。在此基础上,变比特率机制在推断时调整激活专家量化器的数量,实现无需重新训练的多比特率操作。 实验表明,SwitchCodec 在客观指标和主观听感测试方面均优于现有基线。

关键词

引用

@article{arxiv.2601.20362,
  title  = {Switchcodec: Adaptive residual-expert sparse quantization for high-fidelity neural audio coding},
  author = {Xiangbo Wang and Wenbin Jiang and Jin Wang and Yubo You and Sheng Fang and Fei Wen},
  journal= {arXiv preprint arXiv:2601.20362},
  year   = {2026}
}

备注

This manuscript contains critical errors in the experimental parameter settings and partial algorithm derivation in Section 3 and Section 4, which will lead to inaccurate conclusion interpretation. We need to withdraw the paper for comprehensive revision, re-calculation and experimental verification, and will resubmit after full correction