LEAF:一种用于音频分类的可学习前端
声音
2021-01-22 v1 机器学习
音频与语音处理
摘要
梅尔滤波器组是固定的、工程化的音频特征,其模拟人类感知,并贯穿音频理解的历史沿用至今。然而,其不可否认的优点被手工表征的根本局限所抵消。在本工作中,我们展示可以训练一个单一的可学习前端,在包括语音、音乐、音频事件和动物声音在内的广泛音频信号上优于梅尔滤波器组,从而为音频分类提供一种通用目的的学习前端。为此,我们引入了一种新的、有原则的、轻量的、完全可学习的架构,可用作梅尔滤波器组的直接替代。我们的系统学习音频特征提取的所有操作,从滤波到池化、压缩和归一化,并且可以以可忽略的参数代价集成到任何神经网络中。我们在八个不同的音频分类任务上进行多任务训练,并展示我们的模型相对于梅尔滤波器组和先前可学习替代方案的一致改进。此外,我们的系统在 Audioset 上以少数个数量级的参数优于当前最先进的可学习前端。
引用
@article{arxiv.2101.08596,
title = {LEAF: A Learnable Frontend for Audio Classification},
author = {Neil Zeghidour and Olivier Teboul and Félix de Chaumont Quitry and Marco Tagliasacchi},
journal= {arXiv preprint arXiv:2101.08596},
year = {2021}
}
备注
Accepted at ICLR 2021