零样语音克隆的直流模型:SF-Speech
声音
2025-03-28 v2 音频与语音处理
摘要
最近,基于神经常微分方程(ODE)的流匹配模型在零样语音克隆任务中取得了令人印象的性能。然而,假设标准高斯噪声作为ODE的初始分布会导致流匹配目标的大量交叉,这给模型训练带来挑战,并增强了所学习生成轨迻的曲率。这些弯曲轨迻限制了ODE模型在少数步骤内生成理想样本的能力。本文提出了SF-Speech,一种基于ODE和in-context学习的新型语音克隆模型。不同于以往工作,SF-Speech采用轻量级的多阶段模块生成更确定性的初始分布,以ODE为核心。无需引入额外的损失函数,我们通过联合训练所提出的模块,有效地直化了ODE模型的反向轨迻。在 various scale 数据集上的实验结果表明,SF-Speech 在零样 TTS 方法中超越了最先进的性能,只需原 VoiceBox 和 E2 TTS 的四分之一求解器步骤,生成速度约为3.7倍。音频样本可在 demo 页面\footnote{[Online] Available: https://lixuyuan102.github.io/Demo/}获取。
关键词
引用
@article{arxiv.2410.12399,
title = {SF-Speech: Straightened Flow for Zero-Shot Voice Clone},
author = {Xuyuan Li and Zengqiang Shang and Hua Hua and Peiyang Shi and Chen Yang and Li Wang and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2410.12399},
year = {2025}
}
备注
Accepted by IEEE Transactions on Audio, Speech and Language Processing