将 ConvNeXt 模型适配至 AudioSet 上的音频分类
声音
2023-06-02 v1 音频与语音处理
摘要
在计算机视觉中,诸如 ConvNeXt 的卷积神经网络(CNN)已能够超越最先进的 transformer,部分归功于深度可分离卷积(DSC)。作为常规卷积的近似,DSC 在不降低其准确率甚至有时提高准确率的情况下,使 CNN 在时间和内存复杂度上更加高效。在本文中,我们首先将 DSC 实现到预训练音频神经网络(PANN)家族中,用于 AudioSet 上的音频分类,以展示其在准确率/模型大小权衡方面的优势。其次,我们将如今著名的 ConvNeXt 模型适配至相同任务。它迅速过拟合,因此我们报告了改善学习过程的技术。我们最佳的 ConvNeXt 模型在 AudioSet 上达到了 0.471 的平均精度均值,优于或等同于近期的大型音频 transformer,同时使用的参数量减少了三倍。我们使用该模型在音频字幕和音频检索中也取得了积极成果。我们的 PyTorch 源代码和检查点模型可在 https://github.com/topel/audioset-convnext-inf 获取。
引用
@article{arxiv.2306.00830,
title = {Adapting a ConvNeXt model to audio classification on AudioSet},
author = {Thomas Pellegrini and Ismail Khalfaoui-Hassani and Etienne Labbé and Timothée Masquelier},
journal= {arXiv preprint arXiv:2306.00830},
year = {2023}
}
备注
Accepted at INTERSPEECH 2023