中文

DS-Codec:基于镜像至非镜像架构切换的双阶段训练语音编解码器

声音 2025-06-02 v1 音频与语音处理

摘要

神经语音编解码器对于推进文本到语音系统至关重要。随着大型语言模型在文本生成方面的近期成功,开发高质量的语音分词器变得越来越重要。本文介绍了 DS-Codec,一种具有双阶段训练框架和镜像与非镜像架构切换的新颖神经语音编解码器,旨在实现卓越的语音重建。我们进行了广泛的实验和消融研究,以评估我们训练策略的有效性,并比较了两种架构的性能。我们的结果表明,镜像结构显著增强了所学码本的鲁棒性,并且该训练策略平衡了镜像与非镜像结构之间的优势,从而改进了高保真语音重建。

关键词

引用

@article{arxiv.2505.24314,
  title  = {DS-Codec: Dual-Stage Training with Mirror-to-NonMirror Architecture Switching for Speech Codec},
  author = {Peijie Chen and Wenhao Guan and Kaidi Wang and Weijie Wu and Hukai Huang and Qingyang Hong and Lin Li},
  journal= {arXiv preprint arXiv:2505.24314},
  year   = {2025}
}

备注

Accepted to Interspeech 2025