轻量级零样本文本到语音方法:混合式适配器
声音
2024-07-02 v1 计算与语言
机器学习
音频与语音处理
摘要
基于大规模模型的零样本文本到语音(TTS)方法的发展,已在再现说话人特征方面表现出高保真度。然而,这些模型过大,难以用于实际日常应用。我们提出了一种使用混合式适配器(Mixture of Adapters, MoA)的轻量级零样本TTS方法。我们的方法将MoA模块嵌入非自回归TTS模型的解码器和方差适配器中。这些模块通过基于说话人嵌入选择与说话人特征相关的适配器,增强了对广泛说话人的零样本适应能力。我们的方法在最小化额外参数的同时实现了高质量语音合成。通过客观和主观评估,我们确认相较于基线模型,本方法在参数不足40%的情况下实现了更好的性能,推理速度提升了1.9倍。音频样本可在我们的演示页面(https://ntt-hilab-gensp.github.io/is2024lightweightTTS/)上获取。
引用
@article{arxiv.2407.01291,
title = {Lightweight Zero-shot Text-to-Speech with Mixture of Adapters},
author = {Kenichi Fujita and Takanori Ashihara and Marc Delcroix and Yusuke Ijima},
journal= {arXiv preprint arXiv:2407.01291},
year = {2024}
}
备注
5 pages,3 figures, Accepted to INTERSPEECH 2024