DarkGAN:利用知识蒸馏实现可理解的 GAN 音频合成
声音
2021-08-04 v1 音频与语音处理
摘要
生成对抗网络 (GAN) 近年来已取得了卓越的音频合成质量。然而,使其能够通过语义上有意义的控制进行操作仍然是一个开放的挑战。一种显而易见的方法是通过将 GAN 以音频数据集中包含的元数据为条件来控制它。不幸的是,音频数据集往往缺乏所需的标注,尤其是在音乐领域。规避这种标注缺乏的一种方法是生成标注,例如使用自动音频标记系统。此类系统的输出概率(所谓的“软标签”)携带着关于相应音频特征的丰富信息,可用于将知识从教师模型蒸馏到学生模型中。在这项工作中,我们从一个大型音频标记系统向一个我们称之为 DarkGAN 的对抗性音频合成器进行知识蒸馏。结果表明,DarkGAN 能够合成质量可接受的音乐音频,并且即使在分布外输入条件下也表现出适度的属性控制。我们在随附网站上发布了代码并提供了音频示例。
引用
@article{arxiv.2108.01216,
title = {DarkGAN: Exploiting Knowledge Distillation for Comprehensible Audio Synthesis with GANs},
author = {Javier Nistal and Stefan Lattner and Gaël Richard},
journal= {arXiv preprint arXiv:2108.01216},
year = {2021}
}
备注
9 pages, 3 figures, 2 tables, accepted to ISMIR2021