Discl-VC:解耦离散词元与上下文学习用于可控零样本语音转换
声音
2025-06-02 v1 人工智能
音频与语音处理
摘要
目前,零样本语音转换系统能够合成未见说话人的声音。然而,大多数现有方法难以准确复制源说话人的说话风格或模仿目标说话人的独特说话风格,从而限制了语音转换的可控性。本文提出 Discl-VC,一种新颖的语音转换框架,该框架从自监督语音表示中解耦内容与韵律信息,并通过基于流匹配 Transformer 的上下文学习合成目标说话人的声音。为实现对生成语音韵律的精确控制,我们引入了一种掩码生成 Transformer,它基于提示以非自回归方式预测离散韵律词元。实验结果证明了 Discl-VC 在零样本语音转换中的优越性能,及其在合成语音韵律控制上的显著准确性。
引用
@article{arxiv.2505.24291,
title = {Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot Voice Conversion},
author = {Kaidi Wang and Wenhao Guan and Ziyue Jiang and Hukai Huang and Peijie Chen and Weijie Wu and Qingyang Hong and Lin Li},
journal= {arXiv preprint arXiv:2505.24291},
year = {2025}
}