环境声音表示的抗扰动鲁棒性研究
声音
2022-07-08 v3 人工智能
机器学习
音频与语音处理
摘要
涉及环境声音分析的声音应用日益使用通用音频表示,也称为嵌入(embeddings),进行迁移学习。最近,音频表示整体评估(HEAR)在十九项多样任务上评估了二十九个嵌入模型。然而,评估的有效性取决于给定数据集内已捕获的变化。因此,对于给定数据域,尚不清楚表示将如何受到无数麦克风范围与声学条件——通常称为信道效应——所引起的变化的影响。我们旨在扩展 HEAR 以评估对此工作中信道效应的不变性。为此,我们通过向音频信号注入扰动来模拟信道效应,并用三种距离度量衡量新(受扰)嵌入中的偏移,使评估依赖于域而不依赖于任务。结合下游性能,它帮助我们更有依据地预测嵌入对信道效应的鲁棒程度。我们在单声(UrbanSound8K)与多声(SONYC-UST)城市数据集上评估了两个嵌入——YAMNet 与 OpenL3。我们表明在此类任务无关评估中单一距离度量并不足够。尽管 Fréchet 音频距离(FAD)最准确地与下游任务中性能下降的趋势相关,我们表明需要结合其他距离研究 FAD 以清晰理解扰动的整体效应。就嵌入性能而言,我们发现 OpenL3 比 YAMNet 更鲁棒,这与 HEAR 评估一致。
引用
@article{arxiv.2203.10425,
title = {A Study on Robustness to Perturbations for Representations of Environmental Sound},
author = {Sangeeta Srivastava and Ho-Hsiang Wu and Joao Rulff and Magdalena Fuentes and Mark Cartwright and Claudio Silva and Anish Arora and Juan Pablo Bello},
journal= {arXiv preprint arXiv:2203.10425},
year = {2022}
}
备注
Accepted in EUSIPCO 2022