U-Style:基于级联 U-Net 与多级说话人与风格建模的零样本语音克隆
声音
2023-10-09 v1 音频与语音处理
摘要
零样本说话人克隆旨在仅给定目标说话人的单条语音参考时,合成该说话人(在 TTS 系统构建期未见过)的语音。尽管在实际应用中更具实用性,当前零样本方法合成的语音在自然度和说话人相似度上仍不尽如人意。此外,在零样本设定下赋予目标说话人任意说话风格尚未被考虑。这是因为零样本说话人与风格克隆的独特挑战在于,仅从代表任意说话人与任意风格的短参考中学习解耦的说话人与风格表征。为应对此挑战,我们提出 U-Style,其以 Grad-TTS 为骨干,特别是在文本编码器与扩散解码器之间级联一个说话人特定编码器与一个风格特定编码器。从而,借助信号扰动,U-Style 被显式解耦为说话人与风格特定建模部分,实现更好的说话人与风格解耦。为提升未见说话人与风格建模能力,这两个编码器通过跳跃连接的 U-Net 进行多级说话人与风格建模,融合表征提取与信息重建过程。此外,为提升合成语音自然度,我们在这些编码器中分别采用基于均值的实例归一化与风格自适应层归一化来进行表征提取与条件适配。实验表明,U-Style 在未见说话人克隆的自然度与说话人相似度上显著超越最先进方法。值得注意的是,U-Style 可将风格从一未见源说话人迁移至另一未见目标说话人,在零样本语音克隆中实现所需说话人音色与风格的灵活组合。
引用
@article{arxiv.2310.04004,
title = {U-Style: Cascading U-nets with Multi-level Speaker and Style Modeling for Zero-Shot Voice Cloning},
author = {Tao Li and Zhichao Wang and Xinfa Zhu and Jian Cong and Qiao Tian and Yuping Wang and Lei Xie},
journal= {arXiv preprint arXiv:2310.04004},
year = {2023}
}