中文

DarkGAN:利用知识蒸馏实现可理解的 GAN 音频合成

声音 2021-08-04 v1 音频与语音处理

摘要

生成对抗网络 (GAN) 近年来已取得了卓越的音频合成质量。然而,使其能够通过语义上有意义的控制进行操作仍然是一个开放的挑战。一种显而易见的方法是通过将 GAN 以音频数据集中包含的元数据为条件来控制它。不幸的是,音频数据集往往缺乏所需的标注,尤其是在音乐领域。规避这种标注缺乏的一种方法是生成标注,例如使用自动音频标记系统。此类系统的输出概率(所谓的“软标签”)携带着关于相应音频特征的丰富信息,可用于将知识从教师模型蒸馏到学生模型中。在这项工作中,我们从一个大型音频标记系统向一个我们称之为 DarkGAN 的对抗性音频合成器进行知识蒸馏。结果表明,DarkGAN 能够合成质量可接受的音乐音频,并且即使在分布外输入条件下也表现出适度的属性控制。我们在随附网站上发布了代码并提供了音频示例。

关键词

引用

@article{arxiv.2108.01216,
  title  = {DarkGAN: Exploiting Knowledge Distillation for Comprehensible Audio Synthesis with GANs},
  author = {Javier Nistal and Stefan Lattner and Gaël Richard},
  journal= {arXiv preprint arXiv:2108.01216},
  year   = {2021}
}

备注

9 pages, 3 figures, 2 tables, accepted to ISMIR2021