SAC:基于语义-声学双流量化的神经语音编解码器
音频与语音处理
2025-12-16 v2 声音
摘要
将连续语音信号转换为离散标记的语音编解码器已成为语音语言模型中的关键组件。然而,现有编解码器在高质量重构与语义丰富表示之间难以取得平衡,限制了其在生成式和理解任务中的效能。本文提出SAC(语义-声学双流量化神经语音编解码器),通过将语义建模与声学建模解耦为两个专用流,使每个流可针对其职责进行优化。全面评估表明,SAC在干净及噪声条件下均实现了强劲的重构性能,尤其在UTMOS与WER指标上表现突出,显示出卓越的自然度与可理解性。此外,SAC在语义表示方面显著超越先前编解码器,接近连续自监督嵌入的水平。当用作LLM基文本语音合成的标记化器时,SAC enables a single-stage autoregressive(AR)语音合成模型,明显超越最先进的AR系统。我们的解耦分析进一步验证了双流设计的有效性,为可控语音生成开辟了新潜力。
引用
@article{arxiv.2510.16841,
title = {SAC: Neural Speech Codec with Semantic-Acoustic Dual-Stream Quantization},
author = {Wenxi Chen and Xinsheng Wang and Ruiqi Yan and Yushen Chen and Zhikang Niu and Ziyang Ma and Xiquan Li and Yuzhe Liang and Hanlin Wen and Shunshun Yin and Ming Tao and Xie Chen},
journal= {arXiv preprint arXiv:2510.16841},
year = {2025}
}