基于适配器的多说话人文本到语音模型对新说话人的扩展
音频与语音处理
2022-11-02 v1 机器学习
声音
摘要
微调是将文本到语音(TTS)模型适配到新说话人的一种流行方法。然而这种方法存在一些挑战。通常微调需要每位说话人数小时的高质量语音。此外,微调会对已学习说话人的语音合成质量产生负面影响。在本文中,我们提出了一种基于参数高效适配器模块的 TTS 适配替代方法。在所提方法中,向原始网络中添加少量小型适配器模块。原始权重被冻结,仅在新说话人的语音上微调适配器。这种参数高效的微调方法将产生一个与原始模型具有高度参数共享的新模型。我们在 LibriTTS、HiFi-TTS 和 VCTK 数据集上的实验通过客观和主观指标验证了基于适配器方法的有效性。
引用
@article{arxiv.2211.00585,
title = {Adapter-Based Extension of Multi-Speaker Text-to-Speech Model for New Speakers},
author = {Cheng-Ping Hsieh and Subhankar Ghosh and Boris Ginsburg},
journal= {arXiv preprint arXiv:2211.00585},
year = {2022}
}
备注
Submitted to ICASSP 2023