VoiceTailor:面向基于扩散的个性化文本到语音的轻量级插件式适配器
声音
2024-08-29 v2 音频与语音处理
摘要
我们提出VoiceTailor,一种参数高效的说话人自适应文本到语音(TTS)系统,通过为预训练的基于扩散的TTS模型配备个人化适配器来实现。VoiceTailor基于权重变化比率分析识别受益于适配器的关键模块。我们利用低秩适应(Low-Rank Adaptation,LoRA)作为参数高效的适应方法,并将适配器集成到预训练扩散解码器的关键模块中。为实现仅使用少量参数即可获得强大的适应性能,我们探索了各种指导说话人适应的技术,并研究了加强说话人信息的最佳策略。VoiceTailor通过仅微调0.25%的总参数,展示了与现有自适应TTS模型相当的说话人适应性能。如需演示所示,VoiceTailor在适应广泛的真实世界说话人方面表现出强大的鲁棒性。
引用
@article{arxiv.2408.14739,
title = {VoiceTailor: Lightweight Plug-In Adapter for Diffusion-Based Personalized Text-to-Speech},
author = {Heeseung Kim and Sang-gil Lee and Jiheum Yeom and Che Hyun Lee and Sungwon Kim and Sungroh Yoon},
journal= {arXiv preprint arXiv:2408.14739},
year = {2024}
}
备注
INTERSPEECH 2024