中文

基于残差增强的零样态语音转换模型 Vec-Tok-VC+:双模式训练策略中的渐进约束

声音 2024-06-17 v1 音频与语音处理

摘要

零样态语音转换旨在将源语音转换为任意不可见的目标语音,同时保持语言内容不变。近期方法虽在语音转换方面取得显著进展,但在解耦过程中的语义损失以及训练-推理不匹配仍制约转换性能。本文提出 Vec-Tok-VC+,一种改进自 Vec-Tok Codec 的基于提示词的零样态语音转换模型,仅需 3 秒目标说话人提示即可实现语音转换。我们设计了残差增强的 K-Means 解耦器,通过双层聚类过程提升语义内容提取。此外,我们采用教师引导的精炼以模拟转换过程,消除训练-推理不匹配,形成双模式训练策略。进而,我们设计多码本渐进损失函数,从粗到细约束模型逐层输出,提高说话人相似度和内容准确性。客观与主观评估表明,Vec-Tok-VC+ 在自然度、可理解性和说话人相似度方面均优于强基准。

关键词

引用

@article{arxiv.2406.09844,
  title  = {Vec-Tok-VC+: Residual-enhanced Robust Zero-shot Voice Conversion with Progressive Constraints in a Dual-mode Training Strategy},
  author = {Linhan Ma and Xinfa Zhu and Yuanjun Lv and Zhichao Wang and Ziqian Wang and Wendi He and Hongbin Zhou and Lei Xie},
  journal= {arXiv preprint arXiv:2406.09844},
  year   = {2024}
}

备注

Accepted by INTERSPEECH2024