面向文本到语音口音自适应的参数高效学习
声音
2023-08-28 v1 人工智能
神经与进化计算
音频与语音处理
信号处理
摘要
本文提出一种参数高效学习(PEL)方法,用于开发低资源口音自适应的文本到语音(TTS)系统。通过对冻结的预训练 TTS 模型进行资源高效的自适应,仅使用原始可训练参数的 1.2% 至 0.8% 即可在语音合成中取得具有竞争力的性能。受最优传输(OT)理论基础的启发,本研究针对 TTS 实施 PEL,在监督训练损失之外引入基于 OT 的辅助无监督损失,以最大化预训练源域与(未见)目标域之间的差异。进一步,我们利用该无监督损失精炼,通过切片 Wasserstein 距离或最大均值差异来提升系统性能。本工作的优势在于通过残差适配器学习和模型重编程实现了 PEL 方案,并在评估普通话口音自适应时得到验证。实验结果表明,所提方法在参数高效的解码器微调下可取得具有竞争力的自然度,且辅助无监督损失在经验上改善了模型性能。
引用
@article{arxiv.2305.11320,
title = {Parameter-Efficient Learning for Text-to-Speech Accent Adaptation},
author = {Li-Jen Yang and Chao-Han Huck Yang and Jen-Tzung Chien},
journal= {arXiv preprint arXiv:2305.11320},
year = {2023}
}
备注
Accepted to Interspeech 2023