中文

S2VC:一种基于自监督预训练表征的任意到任意语音转换框架

音频与语音处理 2021-06-15 v2 声音

摘要

任意到任意语音转换(VC)旨在将训练中所见或未见任意说话人语音的音色进行转换。已有多种任意到任意 VC 方法被提出,如 AUTOVC、AdaINVC 和 FragmentVC。AUTOVC 与 AdaINVC 利用源编码器和目标编码器解耦特征的内容与说话人信息。FragmentVC 利用两个编码器编码源与目标信息,并采用交叉注意力对齐具有相似音素内容的源与目标特征。此外,还采用了预训练特征。AUTOVC 使用 dvector 提取说话人信息,FragmentVC 中使用 wav2vec 2.0 等自监督学习(SSL)特征提取音素内容信息。与以往工作不同,我们提出 S2VC,利用自监督特征同时作为 VC 模型的源特征与目标特征。被认为与说话人无关且广泛用于 VC 提取内容信息的监督音素后验概率图(PPG)被选为 SSL 特征的强基线。客观与主观评价均表明,以 SSL 特征 CPC 同时作为源与目标特征的模型优于以 PPG 作为源特征的模型,表明 SSL 特征在改进 VC 方面具有巨大潜力。

关键词

引用

@article{arxiv.2104.02901,
  title  = {S2VC: A Framework for Any-to-Any Voice Conversion with Self-Supervised Pretrained Representations},
  author = {Jheng-hao Lin and Yist Y. Lin and Chung-Ming Chien and Hung-yi Lee},
  journal= {arXiv preprint arXiv:2104.02901},
  year   = {2021}
}

备注

Accepted by INTERSPEECH 2021