基于更少标注音频数据的引导式生成对抗神经网络用于表征学习与高保真音频生成
音频与语音处理
2020-06-02 v2 机器学习
声音
机器学习
摘要
生成对抗神经网络(GAN)近期的改进已显示出其生成更高质量样本以及为迁移学习学习良好表征的能力。大多数基于 GAN 的表征学习方法在学习表征时忽略了其后续使用场景,这可能导致泛化能力增强。然而,若模型面向特定任务,则可能变得冗余。例如,假设我们有一个庞大的无标注音频数据集,并希望从该数据集学习一种表征,以用于提升一个小型标注音频数据集的情绪识别性能。在表征学习训练过程中,若模型不知道后续的情绪识别任务,则可能在所学表征中完全忽略与情绪相关的特征。这是任何无监督表征学习模型面临的根本挑战。本文旨在通过提出一种新颖的 GAN 框架:引导式生成神经网络(GGAN)来解决这一挑战,该框架引导 GAN 专注于学习期望的表征,并利用更少的标注样本为音频数据生成更优质量的样本。实验结果表明,使用极少量的标注数据作为引导,GGAN 能学习到显著更好的表征。
引用
@article{arxiv.2003.02836,
title = {Guided Generative Adversarial Neural Network for Representation Learning and High Fidelity Audio Generation using Fewer Labelled Audio Data},
author = {Kazi Nazmul Haque and Rajib Rana and John H. L. Hansen and Björn Schuller},
journal= {arXiv preprint arXiv:2003.02836},
year = {2020}
}
备注
10 pages