中文

零样语音克隆的直流模型:SF-Speech

声音 2025-03-28 v2 音频与语音处理

摘要

最近,基于神经常微分方程(ODE)的流匹配模型在零样语音克隆任务中取得了令人印象的性能。然而,假设标准高斯噪声作为ODE的初始分布会导致流匹配目标的大量交叉,这给模型训练带来挑战,并增强了所学习生成轨迻的曲率。这些弯曲轨迻限制了ODE模型在少数步骤内生成理想样本的能力。本文提出了SF-Speech,一种基于ODE和in-context学习的新型语音克隆模型。不同于以往工作,SF-Speech采用轻量级的多阶段模块生成更确定性的初始分布,以ODE为核心。无需引入额外的损失函数,我们通过联合训练所提出的模块,有效地直化了ODE模型的反向轨迻。在 various scale 数据集上的实验结果表明,SF-Speech 在零样 TTS 方法中超越了最先进的性能,只需原 VoiceBox 和 E2 TTS 的四分之一求解器步骤,生成速度约为3.7倍。音频样本可在 demo 页面\footnote{[Online] Available: https://lixuyuan102.github.io/Demo/}获取。

关键词

引用

@article{arxiv.2410.12399,
  title  = {SF-Speech: Straightened Flow for Zero-Shot Voice Clone},
  author = {Xuyuan Li and Zengqiang Shang and Hua Hua and Peiyang Shi and Chen Yang and Li Wang and Pengyuan Zhang},
  journal= {arXiv preprint arXiv:2410.12399},
  year   = {2025}
}

备注

Accepted by IEEE Transactions on Audio, Speech and Language Processing