中文

EAViT:用于音频分类的外部注意力视觉Transformer

声音 2024-08-26 v1 信息检索 机器学习 音频与语音处理

摘要

本文提出了外部注意力视觉Transformer(EAViT)模型,这是一种旨在提升音频分类准确率的新方法。随着数字音频资源的激增,在音乐流媒体平台和环境声音识别等各种应用中,由于对改进推荐系统和用户个性化的需求,对精确高效音频分类系统的需求日益增强。准确的音频分类对于将庞大的音频库组织成连贯的类别至关重要,使用户能够更有效地找到并与其偏好的音频内容互动。在本研究中,我们使用GTZAN数据集,该数据集包含跨越十个不同流派的1000个音乐片段。每个30秒的音频片段被分割成3秒的片段,以增强数据集的鲁棒性并降低过拟合风险,从而实现更细粒度的特征分析。EAViT模型将多头外部注意力(MEA)机制集成到视觉Transformer(ViT)框架中,有效捕捉样本间的长程依赖关系和潜在相关性。这种外部注意力(EA)机制采用可学习的记忆单元,增强了网络高效处理复杂音频特征的能力。研究表明,EAViT达到了93.99%的显著总体准确率,超越了最先进的模型。

关键词

引用

@article{arxiv.2408.13201,
  title  = {EAViT: External Attention Vision Transformer for Audio Classification},
  author = {Aquib Iqbal and Abid Hasan Zim and Md Asaduzzaman Tonmoy and Limengnan Zhou and Asad Malik and Minoru Kuribayashi},
  journal= {arXiv preprint arXiv:2408.13201},
  year   = {2024}
}