个性化轻量文本转语音:基于自适应结构化剪枝的语音克隆
声音
2023-03-22 v1 音频与语音处理
摘要
个性化TTS是一项令人振奋且备受青睐的应用,它允许用户仅使用少量录音即可训练自己的TTS语音。然而,TTS训练通常需要数小时的录音和一个大型模型,使其不适合部署在移动设备上。为克服这一限制,相关作品通常需要对预训练的TTS模型进行微调,以在适应目标说话人声音的同时保留其生成高质量音频样本的能力。这一过程通常被称为“语音克隆”。尽管相关工作在改变TTS模型声音方面已取得显著成功,但它们仍须从大型预训练模型微调,导致语音克隆模型尺寸较大。在本文中,我们提出将可训练的结构化剪枝应用于语音克隆。通过用语音克隆数据训练结构化剪枝掩码,我们可以为每个目标说话人生成独特的剪枝模型。我们的实验表明,使用可学习的结构化剪枝,我们可以将模型尺寸压缩至原来的1/7,同时取得可比的语音克隆性能。
引用
@article{arxiv.2303.11816,
title = {Personalized Lightweight Text-to-Speech: Voice Cloning with Adaptive Structured Pruning},
author = {Sung-Feng Huang and Chia-ping Chen and Zhi-Sheng Chen and Yu-Pao Tsai and Hung-yi Lee},
journal= {arXiv preprint arXiv:2303.11816},
year = {2023}
}
备注
ICASSP 2023