中文

MaskVCT:基于遮蔽语音编解码器 Transformer 的零样本语音转换,借助多重引导实现更高可控性

音频与语音处理 2026-02-12 v2 人工智能

摘要

我们提出了 MaskVCT,一种基于多种无分类器引导 (CFG) 的零样本语音转换 (VC) 模型,能够实现多因素可控性。虽然先前的 VC 模型依赖固定的条件方案,但 MaskVCT 将多种条件集成于单一模型中。为进一步增强鲁棒性和控制能力,该模型可利用连续或量化语言特征来提升语音清晰度和说话人相似度,亦可使用或省略音高轮廓以控制韵律。这些选择使用户能够在零样本 VC 场景下无缝平衡说话人身份、语言内容和韵律因素。大量实验表明,MaskVCT 在实现最佳目标说话人和方言相似度的同时,与现有基线方法相比,词错率和字符错率表现具竞争力。音频样本可在 https://maskvct.github.io/ 查看。

关键词

引用

@article{arxiv.2509.17143,
  title  = {MaskVCT: Masked Voice Codec Transformer for Zero-Shot Voice Conversion With Increased Controllability via Multiple Guidances},
  author = {Junhyeok Lee and Helin Wang and Yaohan Guan and Thomas Thebaud and Laureano Moro-Velazquez and Jesús Villalba and Najim Dehak},
  journal= {arXiv preprint arXiv:2509.17143},
  year   = {2026}
}

备注

ICASSP 2026 Accepted