中文

CAT:用于音频分类的因果音频Transformer

声音 2023-03-15 v1 多媒体 音频与语音处理

摘要

基于注意力的Transformer因其全局感受野和处理长期依赖的能力,已越来越多地应用于音频分类。然而,现有主要从视觉Transformer扩展而来的框架与音频信号并非完全兼容。本文提出一种因果音频Transformer(CAT),其由多分辨率多特征(MRMF)特征提取与声学注意力块组成,以实现更优的音频建模。此外,我们提出一个因果模块,可缓解过拟合、有助于知识迁移并提升可解释性。CAT在ESC50、AudioSet和UrbanSound8K数据集上取得了更高或与当前最优相当的分类性能,并且可轻松推广至其他基于Transformer的模型。

关键词

引用

@article{arxiv.2303.07626,
  title  = {CAT: Causal Audio Transformer for Audio Classification},
  author = {Xiaoyu Liu and Hanlin Lu and Jianbo Yuan and Xinyu Li},
  journal= {arXiv preprint arXiv:2303.07626},
  year   = {2023}
}

备注

Accepted to ICASSP 2023