MaskCycleGAN-VC:利用填补帧学习非并行语音转换
声音
2021-02-26 v1 机器学习
音频与语音处理
机器学习
摘要
非并行语音转换(VC)是一种无需并行语料库即可训练语音转换器的方法。基于循环一致对抗网络的 VC(CycleGAN-VC 与 CycleGAN-VC2)被广泛接受为基准方法。然而,由于其把握时频结构的能力不足,它们的应用局限于梅尔倒谱转换,尽管近期梅尔谱声码器取得进展,仍无法实现梅尔谱转换。为克服此问题,已提出 CycleGAN-VC3,它是 CycleGAN-VC2 的改进变体,引入了称为时频自适应归一化(TFAN)的附加模块。但这增加了所学参数量。作为替代,我们提出 MaskCycleGAN-VC,它是 CycleGAN-VC2 的另一扩展,使用一种称为填补帧(FIF)的新颖辅助任务进行训练。通过 FIF,我们对输入梅尔谱施加时间掩码,并鼓励转换器基于周围帧填补缺失帧。该任务使转换器以自监督方式学习时频结构,并免除了对 TFAN 等附加模块的需求。关于自然度与说话人相似度的主观评价表明,MaskCycleGAN-VC 以与 CycleGAN-VC2 相近的模型规模优于 CycleGAN-VC2 与 CycleGAN-VC3。音频样本可在 http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/maskcyclegan-vc/index.html 获取。
引用
@article{arxiv.2102.12841,
title = {MaskCycleGAN-VC: Learning Non-parallel Voice Conversion with Filling in Frames},
author = {Takuhiro Kaneko and Hirokazu Kameoka and Kou Tanaka and Nobukatsu Hojo},
journal= {arXiv preprint arXiv:2102.12841},
year = {2021}
}
备注
Accepted to ICASSP 2021. Project page: http://www.kecl.ntt.co.jp/people/kaneko.takuhiro/projects/maskcyclegan-vc/index.html