作为高效预训练音频模型的动态卷积神经网络
声音
2023-10-25 v1 机器学习
音频与语音处理
摘要
大规模音频数据集(如 AudioSet)的引入为 Transformer 征服音频领域并取代 CNN 成为诸多任务上最先进神经网络架构铺平了道路。Audio Spectrogram Transformer 擅长利用大型数据集,创造出强大的预训练模型,在下游任务微调时超越 CNN。然而,当前流行的 Audio Spectrogram Transformer 相较 CNN 在计算复杂度上要求更高。近来,我们已表明通过 Transformer 到 CNN 的知识蒸馏,高效 CNN 可在大型数据集上赶上甚至超越 Transformer。本工作中,我们延续该研究方向,通过引入动态 CNN 模块(由动态非线性、动态卷积与注意力机制构成)提升高效 CNN 的容量。我们表明,在大规模 AudioSet 的音频标注任务上,这些动态 CNN 在性能-复杂度权衡与参数效率方面优于传统高效 CNN。我们的实验进一步指出,所引入的动态 CNN 在下游任务上取得更好性能且良好扩展,在 AudioSet 与若干下游任务上达到 Transformer 性能甚至超越之。
引用
@article{arxiv.2310.15648,
title = {Dynamic Convolutional Neural Networks as Efficient Pre-trained Audio Models},
author = {Florian Schmid and Khaled Koutini and Gerhard Widmer},
journal= {arXiv preprint arXiv:2310.15648},
year = {2023}
}
备注
Submitted to IEEE/ACM Transactions on Audio, Speech, and Language Processing. Source Code available at: https://github.com/fschmid56/EfficientAT