中文

UniCATS:一种基于上下文 VQ-扩散与声码化的统一上下文感知文本转语音框架

声音 2024-03-29 v6 音频与语音处理

摘要

离散语音令牌(分为语义令牌与声学令牌)已被证明在传统声学特征梅尔谱图之上,于文本转语音(TTS)合成的自然度与鲁棒性方面更优。近期流行模型如 VALL-E 与 SPEAR-TTS,通过对从短语音提示中提取的声学令牌进行自回归(AR)续写,实现零样本说话人适配。然而,这些 AR 模型仅能从左至右方向生成语音,不适用于前后文均给定的语音编辑。此外,这些模型依赖声学令牌,其音频质量受音频编解码模型性能限制。本研究提出一种称为 UniCATS 的统一上下文感知 TTS 框架,能够同时完成语音续写与编辑。UniCATS 包含两个组件:声学模型 CTX-txt2vec 与声码器 CTX-vec2wav。CTX-txt2vec 采用上下文 VQ-扩散从输入文本预测语义令牌,使其能融入语义上下文并与周边上下文无缝拼接。随后,CTX-vec2wav 利用上下文声码化将这些语义令牌转换为波形,同时考虑声学上下文。实验结果表明,CTX-vec2wav 在从语义令牌进行语音重合成方面优于 HifiGAN 与 AudioLM。此外,我们展示了 UniCATS 在语音续写与编辑中均达到最先进性能。

关键词

引用

@article{arxiv.2306.07547,
  title  = {UniCATS: A Unified Context-Aware Text-to-Speech Framework with Contextual VQ-Diffusion and Vocoding},
  author = {Chenpeng Du and Yiwei Guo and Feiyu Shen and Zhijun Liu and Zheng Liang and Xie Chen and Shuai Wang and Hui Zhang and Kai Yu},
  journal= {arXiv preprint arXiv:2306.07547},
  year   = {2024}
}

备注

Accepted to AAAI 2024