中文

从声音表示到模型鲁棒性

音频与语音处理 2021-01-19 v3 机器学习 声音

摘要

在本文中,我们研究了不同的标准环境声音表示(谱图)对作为受害者的残差卷积神经网络的识别性能与对抗攻击鲁棒性的影响。在三个基准环境声音数据集上的各类实验平均表明,ResNet-18 模型在分类准确率和训练参数数量方面均优于 GoogLeNet 和 AlexNet 等其他深度学习架构。因此我们将该模型设为后续研究的前端分类器。在此,我们测量了生成更具信息量的梅尔频率倒谱系数(MFCC)、短时傅里叶变换(STFT)和离散小波变换(DWT)表示所需的不同设置对我们前端模型的影响。该测量涉及在对抗鲁棒性上比较分类性能。在攻击者分配的平均预算与攻击代价相平衡的情况下,我们展示了识别准确率与针对六种攻击算法的模型鲁棒性之间的反比关系。此外,我们的实验结果表明,虽然训练于 DWT 谱图上的 ResNet-18 模型取得了最高的识别准确率,但与其他二维表示相比,攻击该模型对攻击者而言代价相对更高。

关键词

引用

@article{arxiv.2007.13703,
  title  = {From Sound Representation to Model Robustness},
  author = {Mohammad Esmaeilpour and Patrick Cardinal and Alessandro Lameiras Koerich},
  journal= {arXiv preprint arXiv:2007.13703},
  year   = {2021}
}

备注

12 pages