中文

在低资源语音转换中利用多因子约束传递说话风格

音频与语音处理 2023-03-15 v2 声音

摘要

在语音转换(VC)中,传达语言内容并保持源语音的说话风格(如语调与情感)至关重要。然而,在低资源情形下,即仅能获取目标说话人有限语句时,现有VC方法难以满足该要求并捕捉目标说话人的音色。本文提出一种新颖的VC模型,称为MFC-StyleVC,用于低资源VC任务。具体而言,新提出由聚类方法生成的说话人音色约束,以在不同阶段引导目标说话人音色学习。同时,为防止对目标说话人有限数据的过拟合,感知正则化约束显式地维持模型在特定方面的性能,包括说话风格、语言内容与语音质量。此外,引入一种模拟模式来模拟推理过程,以缓解训练与推理之间的不匹配。在极具表现力的语音上进行的大量实验证明了所提方法在低资源VC中的优越性。

关键词

引用

@article{arxiv.2211.08857,
  title  = {Delivering Speaking Style in Low-resource Voice Conversion with Multi-factor Constraints},
  author = {Zhichao Wang and Xinsheng Wang and Lei Xie and Yuanzhe Chen and Qiao Tian and Yuping Wang},
  journal= {arXiv preprint arXiv:2211.08857},
  year   = {2023}
}

备注

Accepted by ICASSP 2023