中文

基于脉冲响应增强的设备鲁棒声学场景分类

声音 2025-03-17 v2 人工智能 机器学习 音频与语音处理

摘要

对各类录音设备的泛化能力是音频分类模型的关键性能指标。不同类型麦克风因其频率响应各异,会给数字化音频信号带来分布偏移。若训练时未考虑该域偏移,模型在应用于未知设备录制的信号时性能可能严重下降。尤其是,仅用少数几种不同麦克风录制的音频信号训练模型,会使对未知设备的泛化变得困难。为解决此问题,我们将训练集中的音频信号与预录的设备脉冲响应(DIRs)进行卷积,以人为增加录音设备的多样性。我们系统地研究了 DIR 增强在使用 CNN 与 Audio Spectrogram Transformers 的声学场景分类任务上的效果。结果表明,单独使用 DIR 增强的性能与 SOTA 方法 Freq-MixStyle 相近。然而,我们也表明 DIR 增强与 Freq-MixStyle 具有互补性,在训练时未见的设备所录信号上实现了新的 SOTA 性能。

关键词

引用

@article{arxiv.2305.07499,
  title  = {Device-Robust Acoustic Scene Classification via Impulse Response Augmentation},
  author = {Tobias Morocutti and Florian Schmid and Khaled Koutini and Gerhard Widmer},
  journal= {arXiv preprint arXiv:2305.07499},
  year   = {2025}
}

备注

In Proceedings of the 31st European Signal Processing Conference, EUSIPCO 2023. Source Code available at: https://github.com/theMoro/DIRAugmentation/