中文

基于扩散 Transformer 的零样态语音转换

声音 2024-11-18 v1 机器学习 音频与语音处理

摘要

零样态语音转换旨在将源语音信号转换为来自未见说话人的参考语音的音 timbre。传统方法在音 timbre 漏泄、音 timbre 表示不足以及训练与推理任务不匹配方面存在不足。我们提出了 Seed-VC,一种新框架,通过在训练期间引入外部音 timbre 移位器来扰动源语音音 timbre,从而减轻漏泄并实现训练与推理的对齐。此外,我们采用扩散 Transformer,利用整个参考语音语境,通过 in-context learning 捕获细粒度音 timbre 特征。实验表明,Seed-VC 在强基准如 OpenVoice 和 CosyVoice 上进行了优于的零样态语音转换任务,实现更高的说者相似度和更低的词错误率。我们进一步将方法扩展到零样态唱作语音转换,通过纳入基频 (F0) 条件控制,实现与当前最先进方法相当的性能。我们的发现凸显了 Seed-VC 在克服核心挑战方面的有效性,为更准确和灵活的语音转换系统铺平了道路。

关键词

引用

@article{arxiv.2411.09943,
  title  = {Zero-shot Voice Conversion with Diffusion Transformers},
  author = {Songting Liu},
  journal= {arXiv preprint arXiv:2411.09943},
  year   = {2024}
}