ASM:音频频谱图混合器
声音
2024-01-23 v1 音频与语音处理
摘要
近年来,Transformer 结构在深度学习领域展现了出色的能力,显著提高了各种领域模型的准确性。由于其复杂的网络拓扑和较高的推理成本,研究人员开始质疑这种复杂的网络结构是否真的必要,以及是否能以较低的推理成本取得同样出色的结果。为了证明 Mixer 在 Speech Commands、UrbanSound8k 和 CASIA 中文情感语料库这三个数据集上的有效性,本文将一种更精简的 Mixer 版本应用于音频分类任务,并与基于 Transformer 的音频频谱图 Transformer(AST)模型进行了对比实验。此外,本文还对 Mixer 中几种激活函数的应用进行了对比实验,即 GeLU、Mish、Swish 和 Acon-C。此外,本研究通过对比实验比较了 Mixer 中各种激活函数(包括 GeLU、Mish、Swish 和 Acon-C)的使用。此外,本文指出了 AST 模型的一些缺陷,并据此改进了本研究提出的模型。总之,本研究提出了一种名为音频频谱图混合器的模型,这是首个将 Mixer 用于音频分类的模型,并探讨了该模型未来的改进方向。
引用
@article{arxiv.2401.11102,
title = {ASM: Audio Spectrogram Mixer},
author = {Qingfeng Ji and Jicun Zhang and Yuxin Wang},
journal= {arXiv preprint arXiv:2401.11102},
year = {2024}
}