CAT:用于音频分类的因果音频Transformer
声音
2023-03-15 v1 多媒体
音频与语音处理
摘要
基于注意力的Transformer因其全局感受野和处理长期依赖的能力,已越来越多地应用于音频分类。然而,现有主要从视觉Transformer扩展而来的框架与音频信号并非完全兼容。本文提出一种因果音频Transformer(CAT),其由多分辨率多特征(MRMF)特征提取与声学注意力块组成,以实现更优的音频建模。此外,我们提出一个因果模块,可缓解过拟合、有助于知识迁移并提升可解释性。CAT在ESC50、AudioSet和UrbanSound8K数据集上取得了更高或与当前最优相当的分类性能,并且可轻松推广至其他基于Transformer的模型。
引用
@article{arxiv.2303.07626,
title = {CAT: Causal Audio Transformer for Audio Classification},
author = {Xiaoyu Liu and Hanlin Lu and Jianbo Yuan and Xinyu Li},
journal= {arXiv preprint arXiv:2303.07626},
year = {2023}
}
备注
Accepted to ICASSP 2023