GenerSpeech:面向可泛化域外语音合成的风格迁移
音频与语音处理
2022-10-14 v2 计算与语言
声音
摘要
面向域外(OOD)语音合成的风格迁移旨在从声学参考中生成具有未见风格(如说话人身份、情感和韵律)的语音样本,同时面临以下挑战:1) 表现力语音中高度动态的风格特征难以建模与迁移;2) TTS模型应足够鲁棒以处理不同于源数据的多样OOD条件。本文提出GenerSpeech,一种面向高保真零样本OOD定制语音风格迁移的文本到语音模型。GenerSpeech通过引入两个组件将语音变化分解为风格无关与风格特定部分:1) 多级风格适配器,以高效建模大范围风格条件,包括全局说话人与情感特征,以及局部(语句、音素和词级)细粒度韵律表示;2) 具有Mix-Style层归一化的可泛化内容适配器,以消除语言内容表示中的风格信息,从而提升模型泛化能力。我们在零样本风格迁移上的评估表明,GenerSpeech在音频质量与风格相似度方面超越了SOTA模型。面向自适应风格迁移的扩展研究进一步显示,GenerSpeech在少样本数据设定下表现鲁棒。音频样本可在https://GenerSpeech.github.io/获取。
引用
@article{arxiv.2205.07211,
title = {GenerSpeech: Towards Style Transfer for Generalizable Out-Of-Domain Text-to-Speech},
author = {Rongjie Huang and Yi Ren and Jinglin Liu and Chenye Cui and Zhou Zhao},
journal= {arXiv preprint arXiv:2205.07211},
year = {2022}
}
备注
Accepted to NeurIPS 2022