中文

SoCodec:面向高效基于语言模型的文本到语音合成的语义有序多流语音编解码器

声音 2024-09-04 v1 音频与语音处理

摘要

长语音序列是基于语言模型(LM)的文本到语音合成方法在建模复杂度和效率方面的主要挑战。本工作提出了SoCodec——一种语义有序多流语音编解码器,以解决此问题。它将语音压缩为较短的、多流离散语义序列,在每个帧上拥有多个标记。同时,提出了有序乘积量化以约束该序列为有序表示。可与多流延迟LM结合应用,以在TTS中实现时间和流轴上的更好自回归生成。实验结果充分证明了所提方法的有效性,即使将语音帧移从20ms压缩到240ms(12倍),仍能在基线系统上取得优异性能。消融研究进一步验证了在追求更短语音序列以实现高效LM-based TTS中,学习所提有序多流语义表示的重要性。

关键词

引用

@article{arxiv.2409.00933,
  title  = {SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis},
  author = {Haohan Guo and Fenglong Xie and Kun Xie and Dongchao Yang and Dake Guo and Xixin Wu and Helen Meng},
  journal= {arXiv preprint arXiv:2409.00933},
  year   = {2024}
}

备注

Accepted by SLT 2024