中文

SNIPER 训练:面向文本到语音的单次稀疏训练

音频与语音处理 2024-06-04 v2 声音

摘要

近年来,文本到语音(TTS)模型已实现了显著的自然度,但像大多数深度神经模型一样,其参数量超出必要。稀疏 TTS 模型可通过剪枝与额外重训练改进稠密模型,或以一定性能损失比稠密模型收敛更快。因此,我们提出使用衰减稀疏度训练 TTS 模型,即先以高初始稀疏度加速训练,随后逐步降低稀疏率以获得更优的最终性能。这种递减式方法不同于当前将稀疏度递增至目标值的方法,后者比稠密训练耗费显著更多时间。我们将该方法称为 SNIPER 训练:单次初始化剪枝演化率训练(Single-shot Initialization Pruning Evolving-Rate training)。我们在 FastSpeech2 上的实验表明,使用 SNIPER 能在最初几个训练轮次获得更优损失,且最终 SNIPER 训练的模型优于恒定稀疏度模型并略胜稠密模型,训练时间差异可忽略。

关键词

引用

@article{arxiv.2211.07283,
  title  = {SNIPER Training: Single-Shot Sparse Training for Text-to-Speech},
  author = {Perry Lam and Huayun Zhang and Nancy F. Chen and Berrak Sisman and Dorien Herremans},
  journal= {arXiv preprint arXiv:2211.07283},
  year   = {2024}
}