中文

MaskCycleGAN-VC:利用填补帧学习非并行语音转换

声音 2021-02-26 v1 机器学习 音频与语音处理 机器学习

摘要

非并行语音转换(VC)是一种无需并行语料库即可训练语音转换器的方法。基于循环一致对抗网络的 VC(CycleGAN-VC 与 CycleGAN-VC2)被广泛接受为基准方法。然而,由于其把握时频结构的能力不足,它们的应用局限于梅尔倒谱转换,尽管近期梅尔谱声码器取得进展,仍无法实现梅尔谱转换。为克服此问题,已提出 CycleGAN-VC3,它是 CycleGAN-VC2 的改进变体,引入了称为时频自适应归一化(TFAN)的附加模块。但这增加了所学参数量。作为替代,我们提出 MaskCycleGAN-VC,它是 CycleGAN-VC2 的另一扩展,使用一种称为填补帧(FIF)的新颖辅助任务进行训练。通过 FIF,我们对输入梅尔谱施加时间掩码,并鼓励转换器基于周围帧填补缺失帧。该任务使转换器以自监督方式学习时频结构,并免除了对 TFAN 等附加模块的需求。关于自然度与说话人相似度的主观评价表明,MaskCycleGAN-VC 以与 CycleGAN-VC2 相近的模型规模优于 CycleGAN-VC2 与 CycleGAN-VC3。音频样本可在 http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/maskcyclegan-vc/index.html 获取。

关键词

引用

@article{arxiv.2102.12841,
  title  = {MaskCycleGAN-VC: Learning Non-parallel Voice Conversion with Filling in Frames},
  author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Nobukatsu Hojo},
  journal= {arXiv preprint arXiv:2102.12841},
  year   = {2021}
}

备注

Accepted to ICASSP 2021. Project page: http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/maskcyclegan-vc/index.html