在低资源语音转换中利用多因子约束传递说话风格
音频与语音处理
2023-03-15 v2 声音
摘要
在语音转换(VC)中,传达语言内容并保持源语音的说话风格(如语调与情感)至关重要。然而,在低资源情形下,即仅能获取目标说话人有限语句时,现有VC方法难以满足该要求并捕捉目标说话人的音色。本文提出一种新颖的VC模型,称为MFC-StyleVC,用于低资源VC任务。具体而言,新提出由聚类方法生成的说话人音色约束,以在不同阶段引导目标说话人音色学习。同时,为防止对目标说话人有限数据的过拟合,感知正则化约束显式地维持模型在特定方面的性能,包括说话风格、语言内容与语音质量。此外,引入一种模拟模式来模拟推理过程,以缓解训练与推理之间的不匹配。在极具表现力的语音上进行的大量实验证明了所提方法在低资源VC中的优越性。
引用
@article{arxiv.2211.08857,
title = {Delivering Speaking Style in Low-resource Voice Conversion with Multi-factor Constraints},
author = {Zhichao Wang and Xinsheng Wang and Lei Xie and Yuanzhe Chen and Qiao Tian and Yuping Wang},
journal= {arXiv preprint arXiv:2211.08857},
year = {2023}
}
备注
Accepted by ICASSP 2023