中文

对抗攻击的跨表示可迁移性:从语谱图到音频波形

声音 2020-07-30 v4 机器学习 多媒体 音频与语音处理 机器学习

摘要

本文展示了基于语谱图的音频分类器对对抗攻击的易感性,以及此类攻击向音频波形的可迁移性。一些常用的图像对抗攻击已被应用于梅尔频率与短时傅里叶变换语谱图,此类扰动后的语谱图能够欺骗一个二维卷积神经网络(CNN)。这类攻击产生的扰动语谱图在人类视觉上不可察觉。此外,由扰动语谱图重建的音频波形也能欺骗一个在原始音频上训练的一维 CNN。在西方音乐数据集上的实验结果表明,二维 CNN 在合法样本上取得高达 81.87% 的平均准确率,而在对抗样本上该性能降至 12.09%。同样,一维 CNN 在原始音频样本上取得高达 78.29% 的平均准确率,而在由扰动语谱图重建的对抗音频波形上该性能降至 27.91%。

关键词

引用

@article{arxiv.1910.10106,
  title  = {Cross-Representation Transferability of Adversarial Attacks: From Spectrograms to Audio Waveforms},
  author = {Karl Michel Koerich and Mohammad Esmaeilpour and Sajjad Abdoli and Alceu de Souza Britto and Alessandro Lameiras Koerich},
  journal= {arXiv preprint arXiv:1910.10106},
  year   = {2020}
}

备注

8 pages