MeanVC:基于 Mean Flow 的轻量级流式零样本语音转换
音频与语音处理
2025-12-23 v3 声音
摘要
零样本语音转换(VC)旨在将来自源说话者的时音色传递给任何不可见的目标说话者,同时保留语言内容。日益增长的应用场景对具备流式推理能力的模型提出了迫切需求。这导致需要同时具备快速、轻量级和高保真度的模型。然而,现有流式方法通常依赖于自回归(AR)或非自回归(NAR)框架,这些框架要么需要大量参数才能实现强性能,要么难以泛化到不可见的说话者。本研究提出了 MeanVC,一种轻量级且具备流式处理能力的零样本 VC 方法。MeanVC 引入了一种带块状自回归去噪策略的扩散变换器,结合了 AR 和 NAR 范式的优势,实现高效的流式处理。通过引入 mean flows,MeanVC 在训练期间回归平均速度场,使其能够在单一步采样中通过直接映射从流轨迹的起点到终点,实现零样本 VC,具有卓越的语音质量和说话人相似性。此外,我们采用扩散对抗后训练来缓解过平滑问题并进一步提升语音质量。实验结果表明,MeanVC 显著优于现有的零样本流式 VC 系统,实现了更高的转换质量,同时具有更高的效率和显著更少的参数。音频演示和代码已在 https://aslp-lab.github.io/MeanVC 上公开。
引用
@article{arxiv.2510.08392,
title = {MeanVC: Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows},
author = {Guobin Ma and Jixun Yao and Ziqian Ning and Yuepeng Jiang and Lingxin Xiong and Lei Xie and Pengcheng Zhu},
journal= {arXiv preprint arXiv:2510.08392},
year = {2025}
}