FAST:快速音频语谱变换器
声音
2025-04-21 v1 音频与语音处理
摘要
在音频分类中,开发高效且稳健的模型对于实时应用至关重要。灵感来自MobileViT的设计原则,我们提出了FAST(Fast Audio Spectrogram Transformer),一种新型架构,将卷积神经网络(CNN)和变换器结合起来,发挥两者优势。FAST整合了CNN在局部特征提取效率方面的优势,以及变换器在全局上下文建模能力方面的优势, resulting in a model that is powerful yet lightweight, well-suited to a real-time or mobile use case. 此外,我们引入Lipschitz连续注意力机制以提高训练稳定性并加快收敛速度。在ADIMA数据集上进行评估,该数据集是一个面向实时污秽和滥用检测的多语言语料库,也在更传统的AudioSet上进行评估。我们的結果表明,FAST在ADIMA和AudioSet分类任务中均实现了最先进的性能,在某些情况下在使用最高多达150倍参数的情况下超过了现有基准。
引用
@article{arxiv.2501.01104,
title = {FAST: Fast Audio Spectrogram Transformer},
author = {Anugunj Naman and Gaibo Zhang},
journal= {arXiv preprint arXiv:2501.01104},
year = {2025}
}
备注
Accepted at ICASSP 2025