中文

ASCA:更少音频数据,更深洞察

声音 2023-09-26 v1 机器学习 音频与语音处理

摘要

在鸟鸣和潜艇声学等专业领域的音频识别中,由于采样环境和特异性要求对可用样本的限制,大规模预训练面临挑战。虽然 Transformer 模型在音频识别中表现出色,但其对海量数据的依赖在资源受限场景下成为制约。为此,我们基于 CoAtNet 提出音频频谱图卷积注意力(Audio Spectrogram Convolution Attention,ASCA),融合 Transformer-卷积混合架构、新颖的网络设计与注意力技术,并辅以数据增强与正则化策略。在 BirdCLEF2023 和 AudioSet(Balanced)上,ASCA 分别取得了 81.2% 和 35.1% 的准确率,显著优于对比方法。我们模型的独特结构丰富了输出,使其能够泛化至各类音频检测任务。我们的代码见 https://github.com/LeeCiang/ASCA。

关键词

引用

@article{arxiv.2309.13373,
  title  = {Asca: less audio data is more insightful},
  author = {Xiang Li and Junhao Chen and Chao Li and Hongwu Lv},
  journal= {arXiv preprint arXiv:2309.13373},
  year   = {2023}
}

备注

6 pages,3 figures