音频 GAN 的潜向量恢复
声音
2020-10-19 v1 人工智能
计算机视觉与模式识别
摘要
先进的生成对抗网络(GANs)能够从随机潜向量生成清晰的音频,令人瞩目。本文中,我们研究恢复合成音频与真实音频潜向量的任务。先前的工作通过受自编码器启发的技术恢复给定音频的潜向量,该技术要么与 GAN 并行训练编码器网络,要么在生成器训练后训练。我们的方法训练一个深度残差神经网络架构,将 WaveGAN 合成的音频投影到相应的潜空间,获得近乎一致的重建性能。为了应对真实音频缺乏原始潜向量的问题,我们在真实音频样本与预测潜向量重建音频之间的感知损失上优化残差网络。对于合成音频,还最小化了真实值与恢复潜向量之间的均方误差(MSE)。我们进一步研究了在对预测潜向量施加若干梯度优化步骤时的音频重建性能。通过基于深度神经网络在真实与合成音频上训练的方法,我们能够预测出与真实音频合理重建相对应的潜向量。尽管我们在 WaveGAN 上评估了方法,我们提出的方法是通用的,可应用于任何其他 GANs。
引用
@article{arxiv.2010.08534,
title = {Latent Vector Recovery of Audio GANs},
author = {Andrew Keyes and Nicky Bayat and Vahid Reza Khazaie and Yalda Mohsenzadeh},
journal= {arXiv preprint arXiv:2010.08534},
year = {2020}
}
备注
7 pages, 5 figures