MSM-VC:基于多尺度风格建模的非平行语音转换高保真源风格迁移
音频与语音处理
2023-09-06 v1 声音
摘要
除了将源语音的语言内容传递至转换语音外,保持源语音的说话风格在语音转换(VC)任务中也起着重要作用,这在配音和数据增强等具有高度表现力源语音的诸多场景中至关重要。先前工作通常取源语音的显式韵律特征或定长风格嵌入来建模源语音的说话风格,不足以实现全面的风格建模与目标说话人音色保持。受人类语音风格多尺度特性的启发,本文提出一种面向VC任务的多尺度风格建模方法,称为MSM-VC。MSM-VC从不同层级建模源语音的说话风格。为有效传递说话风格并同时防止源语音向转换语音泄露音色,每一层级的风格由特定表示建模。具体而言,分别采用韵律特征、预训练ASR模型的瓶颈特征,以及通过自监督策略训练的模型提取的特征来建模帧级、局部级和全局级风格。此外,为平衡源风格建模与目标说话人音色保持的性能,MSM-VC引入了由预训练语音情感识别模型和说话人分类器组成的显式约束模块。该显式约束模块还使得在训练中模拟风格迁移推断过程成为可能,从而提升解耦能力并缓解训练与推断间的不匹配。在高度表现力语音语料库上的实验表明,MSM-VC在建模源语音风格的同时保持良好语音质量与说话人相似度方面优于最先进的VC方法。
引用
@article{arxiv.2309.01142,
title = {MSM-VC: High-fidelity Source Style Transfer for Non-Parallel Voice Conversion by Multi-scale Style Modeling},
author = {Zhichao Wang and Xinsheng Wang and Qicong Xie and Tao Li and Lei Xie and Qiao Tian and Yuping Wang},
journal= {arXiv preprint arXiv:2309.01142},
year = {2023}
}
备注
This work was submitted on April 10, 2022 and accepted on August 29, 2023