中文

使用带辅助判别器的保距生成对抗网络进行人脸到音乐翻译

音频与语音处理 2020-06-25 v1 机器学习 声音

摘要

学习两个不相关域(如图像与音频)之间的映射而无任何监督是一项具有挑战性的任务。在本工作中,我们提出一种保距生成对抗模型,将人脸图像翻译到音频域。音频域由 10 个不同乐器族录制的乐音集合(NSynth \cite{nsynth2017})定义,并采用一种距离度量,其中融入了乐器族类别信息与梅尔频率倒谱系数(MFCCs)特征。为强制保距,使用了一种损失项,该损失项惩罚人脸与翻译后音频样本之间成对距离的差异。此外,我们发现生成对抗模型中的保距约束会导致翻译音频样本的多样性降低,并提议使用辅助判别器在采用保距约束的同时增强翻译的多样性。我们还提供了结果的视觉演示与翻译保真度的数值分析。我们提出模型所学翻译的视频演示可在 https://www.dropbox.com/s/the176w9obq8465/face_to_musical_note.mov?dl=0 获取。

关键词

引用

@article{arxiv.2006.13469,
  title  = {Face-to-Music Translation Using a Distance-Preserving Generative Adversarial Network with an Auxiliary Discriminator},
  author = {Chelhwon Kim and Andrew Port and Mitesh Patel},
  journal= {arXiv preprint arXiv:2006.13469},
  year   = {2020}
}

备注

15 pages, 3 figures