中文

NanoVoice:面向多说话人的高效说话人自适应文本转语音

声音 2024-12-24 v2 音频与语音处理

摘要

我们提出NanoVoice,一个为多个说话人同时构建语音适配器的个性化文本转语音模型。NanoVoice引入了能够并行微调多个参考语音的批级说话人适应技术,显著降低训练时间。除了为每个说话人构建独立适配器外,我们还提出了参数共享技术,减少用于说话人适应的参数数量。通过纳入 novel 可训练尺度矩阵,NanoVoice缓解了参数共享期间潜在的性能下降。NanoVoice在性能上与基线模型相当,却训练快4倍,说话人适应参数使用减少45%,且支持40个参考语音。广泛的消融研究和分析进一步验证了模型的高效性。

关键词

引用

@article{arxiv.2409.15760,
  title  = {NanoVoice: Efficient Speaker-Adaptive Text-to-Speech for Multiple Speakers},
  author = {Nohil Park and Heeseung Kim and Che Hyun Lee and Jooyoung Choi and Jiheum Yeom and Sungroh Yoon},
  journal= {arXiv preprint arXiv:2409.15760},
  year   = {2024}
}

备注

IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP), 2025, Demo Page: https://nanovoice.github.io/