GAFX:一种通用音频特征提取器
音频与语音处理
2022-07-20 v1 人工智能
声音
摘要
大多数用于音频任务的机器学习模型都在处理手工设计的特征——频谱图。然而,频谱图是否可被基于深度学习的特征替代仍属未知。本文通过比较不同的可学习神经网络特征提取器与一个成功的频谱图模型来回答这一问题,并提出了一种基于双U-Net(GAFX-U)、ResNet(GAFX-R)和注意力(GAFX-A)模块的通用音频特征提取器(GAFX)。我们设计实验在GTZAN数据集上的音乐流派分类任务中评估该模型,并对我们框架的不同配置及我们的模型GAFX-U进行了详细的消融研究,在遵循Audio Spectrogram Transformer(AST)分类器的情况下取得了具有竞争力的性能。
引用
@article{arxiv.2207.09145,
title = {GAFX: A General Audio Feature eXtractor},
author = {Zhaoyang Bu and Hanhaodi Zhang and Xiaohu Zhu},
journal= {arXiv preprint arXiv:2207.09145},
year = {2022}
}