中文

SynthVC:基于合成数据的端到端低延迟流式语音转换

声音 2025-10-13 v1 音频与语音处理

摘要

语音转换(VC)旨在修改说话人的语音质感 while preserving 语言内容。虽然最近的 VC 模型取得了强大的性能,但大多数在实时流式场景中难以应对,由于高延迟、依赖 ASR 模块或复杂说话人解耦,导致语音质感泄漏或自然性下降。在本工作中,我们提出 SynthVC,一个基于预训练零样本 VC 模型生成的合成平行数据的端到端 VC 框架,直接学习说话人语音质感转换。该设计消除了对显式内容-说话人分离或识别模块的需求。基于神经音频编解码器架构,SynthVC 支持高输出保真度的低延迟流式推理。实验结果表明,SynthVC 在自然性和说话人相似性方面均优于基准流式 VC 系统,端到端延迟仅为 77.1 毫秒。

关键词

引用

@article{arxiv.2510.09245,
  title  = {SynthVC: Leveraging Synthetic Data for End-to-End Low Latency Streaming Voice Conversion},
  author = {Zhao Guo and Ziqian Ning and Guobin Ma and Lei Xie},
  journal= {arXiv preprint arXiv:2510.09245},
  year   = {2025}
}

备注

Accepted by NCMMSC2025