DeCodec: 重新思考音频编解码器作为通用解耦表示学习者的角色
声音
2025-09-12 v1
摘要
通用音频编解码器在音频类型之间学习纠缠表示,而某些特定编解码器提供解耦表示但仅限于语音。然而,真实音频通常包含混合语音和背景声音,下游任务需要选择性访问这些组件。因此,我们重新思考音频编解码器作为通用解耦表示学习者的角色,以实现跨不同音频任务的可控特征选择。为此,我们引入了DeCodec,一种新型神经编解码器,学习将音频表示解耦为专门用于语音和背景声音的正交子空间,并在语音内部,表示进一步分解为语义和副语言成分。这种层次化解耦允许灵活的特征选择,使DeCodec成为多种音频应用的通用前端。技术上,基于编解码器框架,DeCodec包含两个关键创新:子空间正交投影模块,将输入分解为两个解耦的正交子空间,以及表示交换训练程序,确保这两个子空间分别与语音和背景声音相关联。这允许并行残差向量量化(RVQ)独立量化语音和背景声音成分。此外,我们对语音RVQ采用语义引导以实现语义和副语言分解。实验结果表明,DeCodec在保持先进信号重建的同时实现了新能力:通过表示重组在噪声语音上实现优越的语音增强和有效的单次语音转换,通过干净的语义特征提升ASR鲁棒性,以及在TTS中实现可控的背景声音保留/抑制。演示页面:https://luo404.github.io/DeCodecV2/
引用
@article{arxiv.2509.09201,
title = {DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners},
author = {Xiaoxue Luo and Jinwei Huang and Runyan Yang and Yingying Gao and Junlan Feng and Chao Deng and Shilei Zhang},
journal= {arXiv preprint arXiv:2509.09201},
year = {2025}
}