中文

LSCodec:低比特率且语音解耦离散语音编解码器

音频与语音处理 2025-05-22 v3 人工智能 声音

摘要

虽然离散语音标记在语言模型驱动的语音生成中显示出强大的潜力,但其高比特率和冗余的声纹信息限制了此类模型的发展。本文提出了 LSCodec,一种兼具低比特率和语音解耦能力的离散语音编解码器。LSCodec 采用多阶段无监督训练框架,并引入语音扰动技术。首先建立连续信息瓶颈,然后进行向量量化以生成离散的语音解耦空间。最后,离散标记语音合成器对 LSCodec 的输出进行精细化处理以恢复声学细节。通过重建评估,LSCodec 在仅使用单个码本且词汇表大小小于基线模型的情况下,显示出优异的语音清晰度和音频质量。语音转换和说话人探针实验表明 LSCodec 具有出色的说话人解耦能力,消融实验验证了所提训练框架的有效性。

关键词

引用

@article{arxiv.2410.15764,
  title  = {LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec},
  author = {Yiwei Guo and Zhihan Li and Chenpeng Du and Hankun Wang and Xie Chen and Kai Yu},
  journal= {arXiv preprint arXiv:2410.15764},
  year   = {2025}
}

备注

5 pages, 2 figures, 3 tables. Demo page: https://cantabile-kwok.github.io/LSCodec/. Accepted to Interspeech 2025