基于 ACGAN 的数据增强与长期尺度图融合的声学场景分类
音频与语音处理
2021-06-17 v1 声音
摘要
在声学场景分类(ASC)中,声学特征在场景信息提取中起着关键作用,这些信息可存储于不同的时间尺度上。此外,数据集规模有限可能导致模型存在偏差,对来自未见城市的录音和易混淆场景类别表现不佳。为克服此问题,我们提出了一种长期小波特征,与经典梅尔滤波器组系数(FBank)相比,其所需存储容量更低,且分类更快、更准确。该特征可利用类似于 FBank 的预定义小波尺度提取。进一步,采用一种基于带辅助分类器的生成对抗神经网络(ACGAN)的新颖数据增强方案来提升 ASC 系统的泛化能力。该方案包含 ACGAN 和样本滤波器,通过拆分数据集、训练 ACGAN 并随后过滤样本的方式迭代扩展数据库。实验在 Detection and Classification of Acoustic Scenes and Events(DCASE)挑战赛的数据集上进行。在 DCASE19 数据集上的结果表明,所提技术相较经典 FBank 分类器性能更优。此外,所提融合系统在 DCASE19 竞赛中获得第一名,并超越了 DCASE17 数据集上的最高准确率。
引用
@article{arxiv.2005.13146,
title = {ACGAN-based Data Augmentation Integrated with Long-term Scalogram for Acoustic Scene Classification},
author = {Hangting Chen and Zuozhen Liu and Zongming Liu and Pengyuan Zhang},
journal= {arXiv preprint arXiv:2005.13146},
year = {2021}
}