STAA-Net:面向语音情感识别的稀疏且可迁移的对抗攻击
声音
2024-02-05 v1 人工智能
人机交互
音频与语音处理
摘要
语音包含丰富的人类情感信息,语音情感识别(SER)一直是人机交互领域的重要课题。SER模型的鲁棒性至关重要,尤其是在隐私敏感和可靠性要求高的领域,如私人医疗保健。最近,音频领域深度神经网络对对抗攻击的脆弱性已成为一个热门研究领域。然而,先前在音频领域的对抗攻击工作主要依赖于基于迭代梯度的技术,这些技术耗时且容易过拟合特定的威胁模型。此外,具有更好隐蔽性潜力的稀疏扰动在音频领域的探索仍然有限。为了解决这些挑战,我们提出了一种基于生成器的攻击方法,以端到端且高效的方式生成稀疏且可迁移的对抗样本,以欺骗SER模型。我们在两个广泛使用的SER数据集——语音诱发情绪数据库(DEMoS)和交互式情感二元运动捕捉(IEMOCAP)上评估了我们的方法,并证明了其能够高效地生成成功的稀疏对抗样本。此外,我们生成的对抗样本表现出模型无关的可迁移性,能够对先进的受害模型进行有效的对抗攻击。
引用
@article{arxiv.2402.01227,
title = {STAA-Net: A Sparse and Transferable Adversarial Attack for Speech Emotion Recognition},
author = {Yi Chang and Zhao Ren and Zixing Zhang and Xin Jing and Kun Qian and Xi Shao and Bin Hu and Tanja Schultz and Björn W. Schuller},
journal= {arXiv preprint arXiv:2402.01227},
year = {2024}
}