中文

转导并发声:基于语义 token 预测的神经网络转导器文本到语音合成

音频与语音处理 2023-11-09 v2 机器学习

摘要

我们提出了一种基于神经网络转导器 (neural transducer) 的文本到语音 (TTS) 框架。我们使用从 wav2vec2.0 嵌入中获得的离散语义 token,这使得易于将神经网络转导器用于 TTS 框架并享有其单调对齐约束。所提模型首先利用神经网络转导器生成对齐的语义 token,然后利用非自回归 (NAR) 语音生成器从语义 token 合成语音样本。这种解耦框架减轻了 TTS 的训练复杂度,并允许各阶段分别专注于 1) 语言与对齐建模和 2) 细粒度声学建模。零样本自适应 TTS 上的实验结果表明,所提模型在客观与主观度量下于语音质量和说话人相似度上均超越基线。我们还研究了所提模型的推理速度与韵律可控性,展示了神经网络转导器用于 TTS 框架的潜力。

关键词

引用

@article{arxiv.2311.02898,
  title  = {Transduce and Speak: Neural Transducer for Text-to-Speech with Semantic Token Prediction},
  author = {Minchan Kim and Myeonghun Jeong and Byoung Jin Choi and Dongjune Lee and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2311.02898},
  year   = {2023}
}

备注

Accepted at ASRU2023