基于可学习间隔膨胀卷积的音频分类
声音
2023-11-23 v2 人工智能
音频与语音处理
摘要
可学习间隔膨胀卷积(DCLS)是一种近期的卷积方法,其中核元素的位置在训练过程中通过反向传播学习得到。其价值近期已在计算机视觉(ImageNet 分类及下游任务)中得到证明。此处我们表明 DCLS 亦可用于基于 AudioSet 分类基准的音频标注。我们选取了两种使用深度可分离卷积(DSC)的先进卷积架构 ConvNeXt 与 ConvFormer,以及一种额外使用注意力的混合架构 FastViT,并将所有 DSC 层直接替换为 DCLS 层。这在未增加参数量且仅带来较低吞吐代价的情况下,显著提升了三种架构的平均精度均值(mAP)。该方法代码基于 PyTorch,可在 https://github.com/K-H-Ismail/DCLS-Audio 获取。
引用
@article{arxiv.2309.13972,
title = {Audio classification with Dilated Convolution with Learnable Spacings},
author = {Ismail Khalfaoui-Hassani and Timothée Masquelier and Thomas Pellegrini},
journal= {arXiv preprint arXiv:2309.13972},
year = {2023}
}