中文

用于音频事件检测的神经网络架构的鲁棒性

声音 2022-08-01 v3 音频与语音处理

摘要

传统上,在音频识别流程中,噪声由“前端”通过语音增强等预处理技术抑制。然而,并不能保证噪声不会级联到下游流程。为理解噪声对整个音频流程的实际影响,本文直接研究了在无预处理步骤的情况下噪声对不同类型神经模型的影响。我们测量了 4 种不同神经网络模型在 3 类噪声下的环境声音分类任务识别性能:\emph{遮挡}(模拟间歇噪声)、\emph{高斯}噪声(建模连续噪声)和 \emph{对抗扰动}(最坏情况)。我们的直觉是,这些模型处理输入的不同方式(即 CNN 具有强局部性归纳偏置而 Transformer 不具备)应导致可观测的性能及/或鲁棒性差异,理解这一点将带来进一步改进。我们在 AudioSet(最大的弱标记声音事件数据集)上进行了大量实验。我们也试图通过输出分布变化和权重可视化来解释不同模型的行为。

关键词

引用

@article{arxiv.2205.03268,
  title  = {Robustness of Neural Architectures for Audio Event Detection},
  author = {Juncheng B Li and Zheng Wang and Shuhui Qu and Florian Metze},
  journal= {arXiv preprint arXiv:2205.03268},
  year   = {2022}
}