中文

USM-VC: 利用通用语义映射残差块缓解语音转换中的音色泄露

音频与语音处理 2025-06-30 v3 人工智能 声音

摘要

语音转换通过保留内容将源语音转换为目标语音。然而,源说话人的音色信息固有地嵌入在内容表示中,导致严重的音色泄露,降低与目标说话人的相似度。为解决此问题,我们在内容提取器中引入了一个通用语义匹配残差块。该残差块由两个加权分支组成:1)基于通用语义字典的内容特征重表达模块,提供无音色的内容表示;2)到原始内容层的跳跃连接,提供互补的细粒度信息。在内容特征重表达模块中,通用语义字典中的每个条目代表一个音素类别,利用多个说话人的语音统计计算得到,形成一个稳定的、与说话人无关的语义集。我们提出了一种内容特征重表达方法,通过将每个内容帧表示为字典条目的加权线性组合(权重为相应的音素后验概率),获得无音色的内容表示。在各种语音转换框架上的大量实验表明,我们的方法有效缓解了音色泄露,并显著提高了与目标说话人的相似度。

关键词

引用

@article{arxiv.2504.08524,
  title  = {USM-VC: Mitigating Timbre Leakage with Universal Semantic Mapping Residual Block for Voice Conversion},
  author = {Na Li and Chuke Wang and Yu Gu and Zhifeng Li},
  journal= {arXiv preprint arXiv:2504.08524},
  year   = {2025}
}