中文

基于说话人自适应的单样本语音转换风格迁移

音频与语音处理 2022-02-22 v2 声音

摘要

单样本风格迁移是一项具有挑战性的任务,因为仅用一个语句进行训练会使模型极易过拟合训练数据,导致说话人相似度低且缺乏表现力。本文基于识别-合成框架,提出了一种基于说话人自适应的单样本语音转换风格迁移方法。首先,采用一个说话人归一化模块,以去除 ASR 提取的瓶颈特征中与说话人相关的信息。其次,我们在自适应过程中采用权重正则化,以防止因仅使用目标说话人的一个语句作为训练数据而导致的过拟合。最后,为全面解耦语音因素,即内容、说话人、风格,并将源风格迁移至目标,使用了一个韵律模块来提取韵律表征。实验表明,我们的方法在风格和说话人相似度方面均优于当前最先进的单样本 VC 系统;此外,我们的方法还保持了良好的语音质量。

关键词

引用

@article{arxiv.2111.12277,
  title  = {One-shot Voice Conversion For Style Transfer Based On Speaker Adaptation},
  author = {Zhichao Wang and Qicong Xie and Tao Li and Hongqiang Du and Lei Xie and Pengcheng Zhu and Mengxiao Bi},
  journal= {arXiv preprint arXiv:2111.12277},
  year   = {2022}
}

备注

Accepted by ICASSP 2022