通过高效微调学习语音生成的细粒度可控性
音频与语音处理
2024-06-11 v1 计算与语言
摘要
随着生成模型规模的不断增长,预训练模型的高效复用与适配已成为关键考量。在本工作中,我们提出了 Voicebox Adapter,这是一种利用交叉注意力模块将细粒度条件整合到预训练 Voicebox 语音生成模型中的新方法。为确保新增模块与预训练模块的平滑整合,我们探索了多种高效微调方法。实验表明,采用偏置调优配置的 LoRA 取得了最佳性能,在不损害语音质量的前提下增强了可控性。在三个细粒度条件生成任务中,我们展示了 Voicebox Adapter 的有效性与资源效率。后续实验进一步突显了 Voicebox Adapter 在多种数据设置下的鲁棒性。
引用
@article{arxiv.2406.06251,
title = {Learning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning},
author = {Chung-Ming Chien and Andros Tjandra and Apoorv Vyas and Matt Le and Bowen Shi and Wei-Ning Hsu},
journal= {arXiv preprint arXiv:2406.06251},
year = {2024}
}
备注
Accepted by InterSpeech 2024