中文

LEAN:轻量高效音频分类网络

声音 2023-05-23 v1 人工智能 音频与语音处理

摘要

过去几年中,基于AudioSet等大规模数据集的音频分类任务已成为重要研究领域。若干更深的基于卷积的神经网络已展现出引人注目的性能,尤其是Vggish、YAMNet与预训练音频神经网络(PANN)。这些模型可作为迁移学习的预训练架构以及特定音频任务的适配架构。本文中,我们提出一种基于轻量端侧深度学习的音频分类模型LEAN。LEAN由一个称为Wave Encoder的基于原始波形的时序特征提取器,以及基于logmel的预训练YAMNet组成。我们表明,使用可训练的波编码器、预训练YAMNet与基于交叉注意力的时序重对齐相结合,可在下游音频分类任务上取得具竞争力的性能,且内存占用更小,从而使其适用于移动、边缘设备等资源受限设备。我们所提系统在FSD50K数据集上取得端侧平均精度均值(mAP)为.445,内存占用仅4.5MB,较同数据集上基线端侧mAP提升22%。

关键词

引用

@article{arxiv.2305.12712,
  title  = {LEAN: Light and Efficient Audio Classification Network},
  author = {Shwetank Choudhary and CR Karthik and Punuru Sri Lakshmi and Sumit Kumar},
  journal= {arXiv preprint arXiv:2305.12712},
  year   = {2023}
}

备注

Accepted at INDICON 2022