中文

基于多级时频通道检索的零样本语音转换

音频与语音处理 2024-05-21 v3 声音

摘要

零样本语音转换(VC)仅利用目标说话人的一条语音,无需额外模型更新,即可将源语音转换为该说话人的声音。典型方法使用预训练说话人验证(SV)模型的说话人表征,或在 VC 训练过程中学习说话人表征以实现零样本 VC。然而,现有的说话人建模方法忽视了语音在时间和频率通道维度上说话人信息丰富度的变化。这种不充分的说话人建模阻碍了 VC 模型准确表征训练数据集之外未见说话人的能力。在本研究中,我们提出了一种具有多级时频通道检索的鲁棒零样本 VC 模型,称为 MTCR-VC。具体而言,为灵活适应语音在时间和通道轴上的动态变化说话人特征,我们提出了一种称为时频通道检索(TCR)的细粒度说话人建模方法,以发现说话人信息在语音中何时何地出现。该方法在预训练 SV 模型的引导下,从时间和通道两个维度检索变长说话人表征。此外,受人类语音产生的层次化过程启发,MTCR 说话人模块堆叠多个 TCR 块,从多粒度级别提取说话人表征。进一步,为实现更好的语音解耦与重构,我们引入一种基于循环的训练策略来递归模拟零样本推理。我们从内容、风格和说话人三个方面施加周期性约束以驱动该过程。实验表明,MTCR-VC 在建模说话人音色方面优于以往的零样本 VC 方法,同时保持良好的语音自然度。

关键词

引用

@article{arxiv.2305.07204,
  title  = {Multi-level Temporal-channel Speaker Retrieval for Zero-shot Voice Conversion},
  author = {Zhichao Wang and Liumeng Xue and Qiuqiang Kong and Lei Xie and Yuanzhe Chen and Qiao Tian and Yuping Wang},
  journal= {arXiv preprint arXiv:2305.07204},
  year   = {2024}
}

备注

Submitted to TASLP