基于情感音调的说话人识别后门攻击
密码学与安全
2024-09-19 v2
摘要
说话人识别(SI)通过分析说话语音确定说话人的身份。先前研究表明,SI 深度神经网络(DNN)对后门攻击脆弱。后门攻击涉及在 DNN 训练数据中嵌入隐藏触发器,在推理时当这些触发器被检测到时,DNN 会产生错误输出。这项工作首次探讨了使用说话人的情感音调对 SI DNN 实施后门攻击,形成动态且不显眼的触发器。我们使用三个不同的数据集和 DNN 架构进行参数研究,分析情感作为后门触发器对 SI 系统准确率的影响。此外,我们还通过剪枝、STRIP-ViTA 以及三种主流预处理技术(量化、中值滤波和压缩)来探讨攻击的鲁健性。我们的发现表明,上述模型容易受到我们的攻击,表明情感触发器(悲伤和中性音调)可有效用于破坏 SI 系统的完整性。然而,我们的剪枝实验结果表明,通过加固模型可降低攻击成功率最高可达 40%。
引用
@article{arxiv.2408.01178,
title = {EmoBack: Backdoor Attacks Against Speaker Identification Using Emotional Prosody},
author = {Coen Schoof and Stefanos Koffas and Mauro Conti and Stjepan Picek},
journal= {arXiv preprint arXiv:2408.01178},
year = {2024}
}