SoundCLR:用于改进环境声音分类的对比表示学习
声音
2021-03-03 v1 机器学习
音频与语音处理
摘要
环境声音分类(ESC)是非语音音频处理中一个具有挑战性的研究领域。当前 ESC 的大部分研究集中于设计针对特定音频数据集定制特殊架构的深度模型,通常无法利用数据中的内在模式。然而近期研究惊人地表明,从在 ImageNet 上训练的模型进行迁移学习在 ESC 中是一种非常有效的技术。在此,我们提出 SoundCLR,一种用于高效环境声音分类的监督对比学习方法,具有最先进的性能,其通过学习的表示将每一类的样本与其他类的样本解耦来工作。我们的深度网络模型通过结合对比损失与分类层输出的交叉熵损失进行训练,其中对比损失有助于分类层产生更好的概率输出,交叉熵损失用于将样本映射到其各自的独热编码标签。由于可用的环境声音数据集规模相对较小,我们提出并利用了迁移学习和强数据增强流程,并在将声音信号及其对数梅尔谱图输入模型之前对两者均施加增强。我们的实验表明,基于掩码的对数梅尔谱图增强技术可显著提升识别性能。我们广泛的基准实验表明,用对比与交叉熵组合损失训练的混合并行深度网络模型在三个基准数据集 ESC-10、ESC-50 和 US8K 上取得了最先进性能,验证准确率分别为 99.75%、93.4% 和 86.49%。我们模型的集成版本也优于其他顶级集成方法。代码见 https://github.com/alireza-nasiri/SoundCLR。
引用
@article{arxiv.2103.01929,
title = {SoundCLR: Contrastive Learning of Representations For Improved Environmental Sound Classification},
author = {Alireza Nasiri and Jianjun Hu},
journal= {arXiv preprint arXiv:2103.01929},
year = {2021}
}