中文

AudioRepInceptionNeXt:高效音频识别的轻量级单流架构

声音 2024-04-23 v1 音频与语音处理

摘要

近期研究成功将基于视觉的卷积神经网络(CNN)架构适用于音频识别任务,采用Mel频谱图。然而,这些CNN的计算成本和内存需求较高,限制了在低端边缘设备上的部署。灵感来自高效视觉模型如InceptionNeXt和ConvNeXt,本文提出AudioRepInceptionNeXt,一种单流架构。其基本模块将并行多支浅层卷积(按不同尺度的k x k内核)拆分为两个级联的多支浅层卷积。第一个多支由并行的多尺度1 x k浅层卷积层组成,随后是类似的多支采用并行的多尺度k x 1浅层卷积层。这降低了计算和内存占用,同时分离了Mel频谱图的时间和频率处理。大尺寸内核捕获全局频率和长时活动,小尺寸内核获取局部频率和短时活动。我们还对多支设计进行重参数化,以进一步提升推理速度而不牺牲准确性。实验表明,AudioRepInceptionNeXt相对于最新的CNN(如Slow-Fast)参数和计算量降低50%以上,推理速度提升1.28倍,同时保持相当的准确性。它在各种音频识别任务中都能稳健地学习。代码已公开:https://github.com/StevenLauHKHK/AudioRepInceptionNeXt。

关键词

引用

@article{arxiv.2404.13551,
  title  = {AudioRepInceptionNeXt: A lightweight single-stream architecture for efficient audio recognition},
  author = {Kin Wai Lau and Yasar Abbas Ur Rehman and Lai-Man Po},
  journal= {arXiv preprint arXiv:2404.13551},
  year   = {2024}
}