EfficientLEAF:一种更快但用途存疑的可学习音频前端
声音
2022-07-13 v1 机器学习
音频与语音处理
摘要
在音频分类中,参数少的可微分听觉滤波器组覆盖了硬编码谱图与原始音频之间的中间地带。LEAF(arXiv:2101.08596)是一种基于Gabor的滤波器组,结合每通道能量归一化(PCEN),已显示出有前景的结果,但计算开销大。通过采用非均匀卷积核尺寸与步长,并将PCEN替换为更易并行化的操作,我们可以更高效地达到类似结果。在六项音频分类任务的实验中,我们的前端以3%的代价匹配了LEAF的准确率,但两者都未能持续优于固定的mel滤波器组。可学习音频前端的探索尚未解决。
引用
@article{arxiv.2207.05508,
title = {EfficientLEAF: A Faster LEarnable Audio Frontend of Questionable Use},
author = {Jan Schlüter and Gerald Gutenbrunner},
journal= {arXiv preprint arXiv:2207.05508},
year = {2022}
}
备注
Accepted at EUSIPCO 2022. Code at https://github.com/CPJKU/EfficientLEAF