音频前端是否应具备自适应性?可学习前端与自适应前端的比较
音频与语音处理
2025-02-06 v1 声音
摘要
手工设计的特征(如梅尔滤波器组)传统上一直是许多音频处理应用的选择。近年来,人们对直接从原始音频波形中提取表示的可学习前端越来越感兴趣。然而,手工设计的滤波器组和当前的可学习前端在推理时都会产生固定的计算图,无法动态适应变化的声学环境,而这是人类听觉系统的一个关键特征。为此,我们通过比较 Ada-FE 前端(一种最近开发的自适应前端,它采用神经自适应反馈控制器来动态调整其频谱分解滤波器的 Q 因子)与现有的可学习前端,探讨了音频前端是否应该具备自适应性的问题。具体来说,我们系统地研究了可学习前端和 Ada-FE,在两种常用的后端骨干网络以及包括语音、声音事件和音乐在内的广泛音频基准上进行了实验。全面的结果表明,我们的 Ada-FE 优于先进的可学习前端,更重要的是,它在各种训练周期下对测试样本表现出令人印象深刻的稳定性或鲁棒性。
引用
@article{arxiv.2502.03260,
title = {Should Audio Front-ends be Adaptive? Comparing Learnable and Adaptive Front-ends},
author = {Qiquan Zhang and Buddhi Wickramasinghe and Eliathamby Ambikairajah and Vidhyasaharan Sethu and Haizhou Li},
journal= {arXiv preprint arXiv:2502.03260},
year = {2025}
}
备注
Accepted by IEEE TASLP