中文

用于基于 CycleGAN 语音转换的轴向残差网络

音频与语音处理 2021-08-25 v3 机器学习 声音

摘要

我们提出一种用于非平行语音转换的新颖架构与改进训练目标。我们所提出的基于 CycleGAN 的模型直接在高频分辨率幅度谱图上执行保形变换,转换其风格(即说话人身份)同时保留语音内容。在整个转换过程中,模型不借助任何类型的压缩中间表示(例如梅尔谱图、低分辨率谱图、分解的网络特征)。我们提出一种高效的轴向残差块架构以支持这一高耗费过程,并对 CycleGAN 损失进行多种修改以稳定训练过程。我们通过实验证明,即便未使用神经声码器,我们所提出的模型也优于 Scyclone,并表现出与 CycleGAN-VC2 相当或更好的性能。

关键词

引用

@article{arxiv.2102.08075,
  title  = {Axial Residual Networks for CycleGAN-based Voice Conversion},
  author = {Jaeseong You and Gyuhyeon Nam and Dalhyun Kim and Gyeongsu Chae},
  journal= {arXiv preprint arXiv:2102.08075},
  year   = {2021}
}