基于残差归一化的高效声学场景分类域泛化
声音
2021-11-15 v1 机器学习
音频与语音处理
摘要
如何通过单一高效设计的声学场景分类系统处理多设备音频输入是一个实际研究课题。本工作中,我们提出残差归一化,一种新颖的特征归一化方法,它使用频率-wise 归一化(带捷径路径的实例归一化)以丢弃不必要的设备特定信息而不损失对分类有用的信息。此外,我们引入一种高效架构 BC-ResNet-ASC,即具有受限感受野的基线架构的修改版本。即便参数量很少,BC-ResNet-ASC 也优于基线架构。通过剪枝、量化和知识蒸馏三种模型压缩方案,我们能在缓解性能退化的同时进一步降低模型复杂度。所提系统在 TAU Urban Acoustic Scenes 2020 Mobile 开发集上以 315k 参数取得 76.3% 平均测试准确率,压缩至 61.0KB 非零参数后取得 75.3% 平均测试准确率。所提方法在 DCASE 2021 挑战赛 TASK1A 中获第一名。
引用
@article{arxiv.2111.06531,
title = {Domain Generalization on Efficient Acoustic Scene Classification using Residual Normalization},
author = {Byeonggeun Kim and Seunghan Yang and Jangho Kim and Simyung Chang},
journal= {arXiv preprint arXiv:2111.06531},
year = {2021}
}
备注
Proceedings of the Detection and Classification of Acoustic Scenes and Events 2021 Workshop (DCASE2021)