面向多语言语音合成终身学习的探索
音频与语音处理
2022-05-20 v2 计算与语言
声音
摘要
本工作提出一种终身学习方法以训练多语言语音合成(TTS)系统,其中每种语言被视为一个独立任务并依次持续学习。它不需要所有语言的合并数据,从而减轻了存储与计算负担。终身学习方法面临的挑战之一是“灾难性遗忘”:在TTS场景中,这意味着当模型适配新语言时,其在先前语言上的性能会迅速退化。我们通过一种基于数据复放的终身学习方法应对该问题。我们将复放过程表述为一个监督学习问题,并提出一个简单而有效的双采样器框架来处理严重语言不平衡的训练样本。通过客观与主观评测,我们表明该监督学习公式优于其他基于梯度和基于正则化的终身学习方法,与微调基线相比实现了43%的Mel倒谱失真降低。
引用
@article{arxiv.2110.04482,
title = {Towards Lifelong Learning of Multilingual Text-To-Speech Synthesis},
author = {Mu Yang and Shaojin Ding and Tianlong Chen and Tong Wang and Zhangyang Wang},
journal= {arXiv preprint arXiv:2110.04482},
year = {2022}
}
备注
Accepted to ICASSP 2022. Camera-ready