中文

AST:音频频谱图 Transformer

声音 2021-07-12 v3 人工智能

摘要

过去十年中,卷积神经网络(CNNs)被广泛采用为端到端音频分类模型的主要构建模块,旨在学习从音频频谱图到相应标签的直接映射。为更好捕获长程全局上下文,近期趋势是在 CNN 之上添加自注意力机制,形成 CNN-注意力混合模型。然而,尚不清楚对 CNN 的依赖是否必要,以及纯粹基于注意力的神经网络是否足以在音频分类中获得良好性能。本文通过引入 Audio Spectrogram Transformer(AST)——首个无卷积、纯粹基于注意力的音频分类模型——来回答该问题。我们在多种音频分类基准上评估 AST,其在 AudioSet 上取得 0.485 mAP、在 ESC-50 上取得 95.6% 准确率、在 Speech Commands V2 上取得 98.1% 准确率的新 SOTA 结果。

关键词

引用

@article{arxiv.2104.01778,
  title  = {AST: Audio Spectrogram Transformer},
  author = {Yuan Gong and Yu-An Chung and James Glass},
  journal= {arXiv preprint arXiv:2104.01778},
  year   = {2021}
}

备注

Accepted at Interspeech 2021. Code at https://github.com/YuanGongND/ast