AdaVITS:面向低计算资源说话人自适应的微型VITS
声音
2022-11-03 v3 音频与语音处理
摘要
文本到语音合成(TTS)中的说话人自适应是在有限数据下微调预训练TTS模型以适应新目标说话人。尽管已有诸多工作面向该任务,由于轻量模型与低计算复杂度的要求带来挑战,针对低计算资源场景的研究甚少。本文提出一种基于VITS的微型TTS模型,名为AdaVITS,用于低计算资源说话人自适应。为有效缩减VITS的参数与计算复杂度,提出基于iSTFT的波形构造解码器以替换原VITS中耗资源的基于上采样的解码器。此外,引入NanoFlow在流块间共享密度估计以缩减先验编码器的参数。进而,为降低文本编码器的计算复杂度,将缩放点积注意力替换为线性注意力。为应对简化模型引发的不稳定性,弃用原文本编码器,通过文本到PPG模块将音素后验图(PPG)用作语言学特征,并作为编码器输入。实验表明,AdaVITS能以8.97M模型参数与0.72GFlops计算复杂度在说话人自适应中生成稳定自然的语音。
引用
@article{arxiv.2206.00208,
title = {AdaVITS: Tiny VITS for Low Computing Resource Speaker Adaptation},
author = {Kun Song and Heyang Xue and Xinsheng Wang and Jian Cong and Yongmao Zhang and Lei Xie and Bing Yang and Xiong Zhang and Dan Su},
journal= {arXiv preprint arXiv:2206.00208},
year = {2022}
}
备注
Accepted by ISCSLP 2022