通过捷径流匹配实现节奏可控且高效的零样本语音转换
音频与语音处理
2025-06-03 v1 声音
摘要
零样本语音转换(VC)旨在将源说话人的音色转换为任意未见过的音色,同时保留语音内容。大多数先前的工作侧重于保留源的韵律,而细粒度的音色信息可能会通过韵律泄露,且将目标韵律转移到合成语音中的研究很少。鉴于此,我们提出了 R-VC,一种节奏可控且高效的零样本语音转换模型。R-VC 采用数据扰动技术并将源语音离散化为 Hubert 内容 token,消除了大量与内容无关的信息。通过利用 Mask Generative Transformer 进行上下文时长建模,我们的模型将语言内容时长调整为所需的目标说话风格,促进了目标说话人节奏的转移。此外,R-VC 在训练期间引入了强大的 Diffusion Transformer (DiT) 和捷径流匹配,不仅以当前噪声水平为条件,还以所需步长为条件来训练网络,从而在更少的采样步骤(甚至仅两步)内实现高音色相似度和高质量语音生成,从而最小化延迟。实验结果表明,R-VC 在使用更小数据集的情况下实现了与 SOTA VC 方法相当的说话人相似度,并在语音自然度、可懂度和风格迁移性能方面超越了它们。
引用
@article{arxiv.2506.01014,
title = {Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching},
author = {Jialong Zuo and Shengpeng Ji and Minghui Fang and Mingze Li and Ziyue Jiang and Xize Cheng and Xiaoda Yang and Chen Feiyang and Xinyu Duan and Zhou Zhao},
journal= {arXiv preprint arXiv:2506.01014},
year = {2025}
}
备注
Accepted by ACL 2025 (Main Conference)