Vevo:基于自监督解耦的可控零样本语音模仿
声音
2025-03-30 v1 人工智能
音频与语音处理
摘要
语音模仿旨在针对特定语音属性(如音色和说话风格)进行生成,但现有方法依赖大量标注数据,难以有效解耦音色与风格,导致在零样本场景下实现可控生成存在挑战。为此,我们提出了Vevo——一个具备可控音色与说话风格的通用零样本语音模仿框架。Vevo包含两个核心阶段:(1)内容-风格建模:给定文本或语音的内容标记作为输入,利用自回归变换器生成内容-风格标记,并由说话风格参考进行提示;(2)声学建模:给定内容-风格标记作为输入,采用流匹配变换器生成声学表示,并由音色参考进行提示。为获得语音的内容与内容-风格标记,我们设计了一种完全自监督的方法,逐步解耦语音的音色、风格和语言内容。具体而言,我们采用 VQ-VAE 作为连续隐藏特征(HuBERT)的分词器,将 VQ-VAE 码本的词汇大小作为信息瓶颈,并仔细调整以获得解耦合的语音表示。仅需在6万小时的有声书语音数据上进行自监督训练,且无需在风格特定语料上进行微调,Vevo 在音调和情感转换任务中表现出与现有方法相当或更好的效果。此外,Vevo 在零样本语音转换和文本转语音任务中的有效性进一步证明了其强大的泛化能力和 versatility。音频样本可在 https://versavoice.github.io 查看。
引用
@article{arxiv.2502.07243,
title = {Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement},
author = {Xueyao Zhang and Xiaohui Zhang and Kainan Peng and Zhenyu Tang and Vimal Manohar and Yingru Liu and Jeff Hwang and Dangna Li and Yuhao Wang and Julian Chan and Yuan Huang and Zhizheng Wu and Mingbo Ma},
journal= {arXiv preprint arXiv:2502.07243},
year = {2025}
}
备注
Accepted by ICLR 2025