中文

任何人都能用 GAN 唱歌

声音 2021-02-23 v1 机器学习 音频与语音处理

摘要

音频合成问题已越来越多地使用深度神经网络来解决。随着生成对抗网络(GAN)的引入,解决该问题又开辟了一条高效且恰当的路径。在本文中,我们提出了一种使用基于卷积长短期记忆(ConvLSTM)的 GAN 并采用 Wasserstein 损失函数优化来合成人声歌唱语音的方法。我们的工作受 Chandna 等人的 WGANSing 启发。我们的模型输入连续的逐帧语言特征和频率特征,以及歌手身份,并输出声码器特征。我们在由 12 名非专业歌手演唱和讲述的 48 首英文歌曲的数据集上训练模型。在推理时,使用重叠相加(overlap-add)程序将顺序块拼接起来。我们使用梅尔倒谱距离(Mel-Cepstral Distance)指标和一项有 18 名参与者的主观听感测试对模型进行了测试。

关键词

引用

@article{arxiv.2102.11058,
  title  = {Anyone GAN Sing},
  author = {Shreeviknesh Sankaran and Sukavanan Nanjundan and G. Paavai Anand},
  journal= {arXiv preprint arXiv:2102.11058},
  year   = {2021}
}

备注

5 pages, 8 figures