针对语音情感识别模型对抗攻击的系统性评估
声音
2024-04-30 v1 密码学与安全
机器学习
音频与语音处理
摘要
近年来,由于语音情感识别(SER)在多个领域的潜在应用以及深度学习技术提供的可能性,它不断受到关注。然而,最近的研究表明,深度学习模型容易受到对抗攻击的影响。在本文中,我们通过在 SER 语境下考察各种对抗性白盒和黑盒攻击对不同语言和性别的影响,系统地评估了这一问题。我们首先提出了一种适用于音频数据处理、特征提取和 CNN-LSTM 架构的方法。观察到的结果突显了 CNN-LSTM 模型对对抗样本的显著脆弱性。事实上,所有考虑的对抗攻击都能显著降低所构建模型的性能。此外,在评估攻击的有效性时,在所分析的语言之间以及男女语音之间观察到了微小差异。总之,这项工作有助于理解 CNN-LSTM 模型的鲁棒性,特别是在 SER 场景下,以及对抗样本的影响。有趣的是,我们的研究结果为以下方面提供了基准:a) 开发更鲁棒的 SER 算法,b) 设计更有效的攻击,c) 研究可能的防御措施,d) 加深对不同语言和性别间语音差异的理解,以及 e) 总体上,增强我们对 SER 任务的理解。
引用
@article{arxiv.2404.18514,
title = {A Systematic Evaluation of Adversarial Attacks against Speech Emotion Recognition Models},
author = {Nicolas Facchinetti and Federico Simonetta and Stavros Ntalampiras},
journal= {arXiv preprint arXiv:2404.18514},
year = {2024}
}