不学习的可学习前端:滤波器组初始化敏感性的量化
音频与语音处理
2023-02-21 v1
摘要
尽管现代语音与音频处理多依赖使用固定音频表示训练的深层神经网络,近期研究提示声学前端与后端联合学习具有巨大潜力。本研究专门关注可学习滤波器组。先前研究报道,在使用初始化为 mel 刻度的可学习滤波器组的前端中,学习到的滤波器与其初始化并无显著差异。利用基于 Gabor 的滤波器组,我们借助多种初始化策略,在语音活动检测与鸟类物种识别两项音频任务上,考察可学习滤波器组对其初始化的敏感性。我们使用 Jensen-Shannon 距离及训练前后所学滤波器的分析。我们表明,尽管整体性能有所提升,滤波器组对其初始化策略表现出强烈敏感性。从初始化值的有限偏移提示,替代优化策略或可使可学习前端达到更优整体性能。
引用
@article{arxiv.2302.10014,
title = {Learnable Frontends that do not Learn: Quantifying Sensitivity to Filterbank Initialisation},
author = {Mark Anderson and Tomi Kinnunen and Naomi Harte},
journal= {arXiv preprint arXiv:2302.10014},
year = {2023}
}
备注
Accepted at ICASSP 2023, 5 pages, 2 figures, 2 tables