中文

SNAC:基于流架构的说话人归一化仿射耦合层用于零样本多说话人文本到语音合成

音频与语音处理 2022-12-28 v1 声音

摘要

零样本多说话人文本到语音(ZSM-TTS)模型旨在以未见说话人的声音特征生成语音样本。ZSM-TTS 的主要挑战是提高未见说话人的整体说话人相似度。对于基于流的的多说话人文本到语音(TTS)模型,最成功的说话人条件方法之一是使用根据给定说话人嵌入向量预测仿射耦合层的尺度与偏置参数的函数。在本文中,我们改进了以往的说话人条件方法,引入了一种说话人归一化仿射耦合(SNAC)层,其利用基于归一化的条件技术以零样本方式实现未见说话人语音合成。新设计的耦合层在训练时通过说话人嵌入向量预测的参数对输入进行显式归一化,从而在推理时对新说话人嵌入执行反归一化的逆过程。所提出的条件方案在 ZSM-TTS 设定下于语音质量与说话人相似度方面取得了最先进的性能。

关键词

引用

@article{arxiv.2211.16866,
  title  = {SNAC: Speaker-normalized affine coupling layer in flow-based architecture for zero-shot multi-speaker text-to-speech},
  author = {Byoung Jin Choi and Myeonghun Jeong and Joun Yeop Lee and Nam Soo Kim},
  journal= {arXiv preprint arXiv:2211.16866},
  year   = {2022}
}

备注

Accepted to IEEE Signal Processing Letters