使用生成对抗网络进行房间分类器的数据增强
音频与语音处理
2020-12-07 v4 声音
摘要
声学环境的分类使机器能更好地理解周围的听觉世界。利用深度学习教机器区分不同房间是一项新的研究领域。与其他学习任务类似,该任务受限于高维度和训练数据有限的问题。数据增强方法已在声音事件检测与场景分类任务中被证明有助于解决此问题。本文提出一种针对混响语音房间分类任务的数据增强方法。训练生成对抗网络(GANs)以生成人工数据,仿佛它们是在真实房间中测量得到。这为分类器提供了额外的训练样本,而无需任何额外的数据收集——后者耗时且常不切实际。我们提出了一种声学环境的表示,用于训练 GANs。该表示基于早期反射的稀疏模型、混响尾部的随机模型以及两者间的混合机制。在所示实验中,所提出的数据增强方法将 CNN-RNN 房间分类器的测试准确率从 89.4% 提升至 95.5%。
引用
@article{arxiv.1901.03257,
title = {Data Augmentation of Room Classifiers using Generative Adversarial Networks},
author = {Constantinos Papayiannis and Christine Evers and Patrick A. Naylor},
journal= {arXiv preprint arXiv:1901.03257},
year = {2020}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing