LEArnable 前端(LEAF)学到了什么?将逐通道能量归一化(PCEN)适配至噪声条件
音频与语音处理
2024-04-11 v1 声音
信号处理
摘要
在各种语音处理系统中使用可学习前端(LEAF)的兴趣日益浓厚。然而,对于其实际学习到的内容以及训练前端不同组件的相对重要性,却缺乏相关分析。在本文中,我们在关键词 spotting、基于语音的情感识别和语言识别任务上研究了这个问题,并发现用于频谱分解的滤波器和用于估计频谱能量变化的低通滤波器没有表现出学习,而逐通道能量归一化(PCEN)是学习的关键组件。随后,我们探索了仅用少量噪声数据适配 PCEN 层的潜力,使其能够学习更适合噪声条件的动态范围压缩。如本文报告的实验结果所示,这反过来使得在纯净语音上训练的系统能够在噪声测试数据上更准确地工作。
引用
@article{arxiv.2404.06702,
title = {What is Learnt by the LEArnable Front-end (LEAF)? Adapting Per-Channel Energy Normalisation (PCEN) to Noisy Conditions},
author = {Hanyu Meng and Vidhyasaharan Sethu and Eliathamby Ambikairajah},
journal= {arXiv preprint arXiv:2404.06702},
year = {2024}
}
备注
Interspeech 2023 Proceeding