从环境声音表示到二维 CNN 模型对抗攻击的鲁棒性
声音
2022-04-15 v1 密码学与安全
计算机视觉与模式识别
机器学习
音频与语音处理
摘要
本文研究了不同的标准环境声音表示(谱图)对受害者残差卷积神经网络(即 ResNet-18)的识别性能与对抗攻击鲁棒性的影响。我们聚焦于此类前端分类器而非其他复杂架构的主要动机,是在识别准确率与训练参数总数之间取得平衡。在此,我们度量了生成更具信息量的梅尔频率倒谱系数(MFCC)、短时傅里叶变换(STFT)与离散小波变换(DWT)表示所需的多种设置对我们前端模型的影响。该度量涉及在对抗鲁棒性上比较分类性能。我们展示了在分配的平均预算与攻击代价平衡下,识别准确率与模型针对六种基准攻击算法的鲁棒性之间存在反向关系。此外,实验结果表明,虽然在 DWT 谱图上训练的 ResNet-18 模型取得了高识别准确率,但与其他二维表示相比,攻击该模型对攻击者而言代价相对更高。我们还报告了在 ResNet-34、ResNet-56、AlexNet、GoogLeNet、SB-CNN 以及基于 LSTM 的不同卷积神经网络架构上的一些结果。
引用
@article{arxiv.2204.07018,
title = {From Environmental Sound Representation to Robustness of 2D CNN Models Against Adversarial Attacks},
author = {Mohammad Esmaeilpour and Patrick Cardinal and Alessandro Lameiras Koerich},
journal= {arXiv preprint arXiv:2204.07018},
year = {2022}
}
备注
32 pages, Preprint Submitted to Journal of Applied Acoustics. arXiv admin note: substantial text overlap with arXiv:2007.13703