中文

AccentSpeech:从众包数据学习口音以实现带口音的目标说话人 TTS

声音 2022-11-01 v1 音频与语音处理

摘要

从众包数据学习口音是实现可合成带口音语音的目标说话人 TTS 系统的可行途径。为此,有两个具挑战性的问题亟待解决。首先,在口音迁移中直接使用声学质量较差的众包数据与目标说话人数据,显然会导致合成语音质量下降。为缓解该问题,我们采用基于瓶颈特征(BN)的 TTS 方法,将 TTS 分解为学习口音的文本到 BN(T2BN)模块与学习说话人音色的 BN 到梅尔(BN2Mel)模块,其中基于神经网络的 BN 特征作为对噪声干扰鲁棒的中间表示。其次,在两阶段系统中直接使用众包数据训练 T2BN 会产生韵律较差的目标说话人口音语音,这是因为众包录音来自普通非专业说话人。为解决该问题,我们将两阶段方法更新为新颖的三阶段方法:T2BN 与 BN2Mel 使用高质量目标说话人数据训练,并在两模块间插入新的 BN 到 BN(BN2BN)模块以执行口音迁移。为训练 BN2BN 模块,通过所提数据增强流程获得并行的无口音与带口音 BN 特征。最终,所提三阶段方法能为目标说话人生成韵律良好的口音语音,因韵律模式继承自专业目标说话人,且口音迁移由 BN2BN 模块同时完成。所提方法命名为 AccentSpeech,在普通话 TTS 口音迁移任务中得到验证。

关键词

引用

@article{arxiv.2210.17305,
  title  = {AccentSpeech: Learning Accent from Crowd-sourced Data for Target Speaker TTS with Accents},
  author = {Yongmao Zhang and Zhichao Wang and Peiji Yang and Hongshen Sun and Zhisheng Wang and Lei Xie},
  journal= {arXiv preprint arXiv:2210.17305},
  year   = {2022}
}

备注

Accepted by ISCSLP2022