中文

环境声音表示的抗扰动鲁棒性研究

声音 2022-07-08 v3 人工智能 机器学习 音频与语音处理

摘要

涉及环境声音分析的声音应用日益使用通用音频表示,也称为嵌入(embeddings),进行迁移学习。最近,音频表示整体评估(HEAR)在十九项多样任务上评估了二十九个嵌入模型。然而,评估的有效性取决于给定数据集内已捕获的变化。因此,对于给定数据域,尚不清楚表示将如何受到无数麦克风范围与声学条件——通常称为信道效应——所引起的变化的影响。我们旨在扩展 HEAR 以评估对此工作中信道效应的不变性。为此,我们通过向音频信号注入扰动来模拟信道效应,并用三种距离度量衡量新(受扰)嵌入中的偏移,使评估依赖于域而不依赖于任务。结合下游性能,它帮助我们更有依据地预测嵌入对信道效应的鲁棒程度。我们在单声(UrbanSound8K)与多声(SONYC-UST)城市数据集上评估了两个嵌入——YAMNet 与 OpenL3。我们表明在此类任务无关评估中单一距离度量并不足够。尽管 Fréchet 音频距离(FAD)最准确地与下游任务中性能下降的趋势相关,我们表明需要结合其他距离研究 FAD 以清晰理解扰动的整体效应。就嵌入性能而言,我们发现 OpenL3 比 YAMNet 更鲁棒,这与 HEAR 评估一致。

关键词

引用

@article{arxiv.2203.10425,
  title  = {A Study on Robustness to Perturbations for Representations of Environmental Sound},
  author = {Sangeeta Srivastava and Ho-Hsiang Wu and Joao Rulff and Magdalena Fuentes and Mark Cartwright and Claudio Silva and Anish Arora and Juan Pablo Bello},
  journal= {arXiv preprint arXiv:2203.10425},
  year   = {2022}
}

备注

Accepted in EUSIPCO 2022