音频Transformer
声音
2025-05-13 v2 人工智能
机器学习
多媒体
音频与语音处理
摘要
在过去的二十年中,CNN架构产生了引人注目的声音感知与认知模型,学习了特征的层次化组织。类似于计算机视觉中的成功,音频特征分类可以在各种数据集和标签上针对特定感兴趣的任务进行优化。事实上,为图像理解设计的类似架构已被证明对声学场景分析有效。这里我们提出将基于Transformer的架构不加卷积层地应用于原始音频信号。在包含200个类别的Free Sound 50K标准数据集上,我们的模型优于卷积模型并取得了最先进结果。这是显著的,因为不同于自然语言处理和计算机视觉,我们并未进行无监督预训练以超越卷积架构。在同一训练集上,就平均精度均值基准而言,我们展示了显著提升。我们通过使用受过去几年设计的卷积网络启发的池化等技术进一步改进Transformer架构的性能。此外,我们还展示了如何将受小波启发的多速率信号处理思想应用于Transformer嵌入以改善结果。我们也展示了我们的模型如何学习一个非线性非恒定带宽滤波器组,其展示了一种用于音频理解任务的适应性时频前端表示,不同于其他任务如音高估计。
引用
@article{arxiv.2105.00335,
title = {Audio Transformers},
author = {Prateek Verma and Jonathan Berger},
journal= {arXiv preprint arXiv:2105.00335},
year = {2025}
}
备注
5 pages, 4 figures; Under review WASPAA 2021; Typo Fixes