中文

通过高效微调学习语音生成的细粒度可控性

音频与语音处理 2024-06-11 v1 计算与语言

摘要

随着生成模型规模的不断增长,预训练模型的高效复用与适配已成为关键考量。在本工作中,我们提出了 Voicebox Adapter,这是一种利用交叉注意力模块将细粒度条件整合到预训练 Voicebox 语音生成模型中的新方法。为确保新增模块与预训练模块的平滑整合,我们探索了多种高效微调方法。实验表明,采用偏置调优配置的 LoRA 取得了最佳性能,在不损害语音质量的前提下增强了可控性。在三个细粒度条件生成任务中,我们展示了 Voicebox Adapter 的有效性与资源效率。后续实验进一步突显了 Voicebox Adapter 在多种数据设置下的鲁棒性。

关键词

引用

@article{arxiv.2406.06251,
  title  = {Learning Fine-Grained Controllability on Speech Generation via Efficient Fine-Tuning},
  author = {Chung-Ming Chien and Andros Tjandra and Apoorv Vyas and Matt Le and Bowen Shi and Wei-Ning Hsu},
  journal= {arXiv preprint arXiv:2406.06251},
  year   = {2024}
}

备注

Accepted by InterSpeech 2024