中文

GenVC:自监督零样本语音转换

音频与语音处理 2025-08-21 v2 机器学习

摘要

当前大多数零样本语音转换方法依赖外部监督组件,特别是说话人编码器进行训练。为了探索消除这种依赖的替代方案,本文引入了 GenVC,这是一种以自监督方式从语音信号中解耦说话人身份和语言内容的新颖框架。GenVC 利用语音分词器和一个自回归的、基于 Transformer 的语言模型作为其语音生成的骨干。这种设计支持大规模训练,同时增强了源说话人隐私保护和目标说话人克隆保真度。实验结果表明,GenVC 实现了显著更高的说话人相似度,自然度与领先的零样本方法相当。此外,由于其自回归表述,GenVC 在时间对齐上引入了灵活性,减少了对源韵律和说话人特定特征的保留,使其在语音匿名化方面非常有效。

关键词

引用

@article{arxiv.2502.04519,
  title  = {GenVC: Self-Supervised Zero-Shot Voice Conversion},
  author = {Zexin Cai and Henry Li Xinyuan and Ashi Garg and Leibny Paola García-Perera and Kevin Duh and Sanjeev Khudanpur and Matthew Wiesner and Nicholas Andrews},
  journal= {arXiv preprint arXiv:2502.04519},
  year   = {2025}
}

备注

accepted by 2025 IEEE ASRU