FoolHD:利用高不可感知对抗扰动欺骗说话人识别
声音
2021-02-23 v2 机器学习
音频与语音处理
摘要
说话人识别模型易受针对其输入信号精心设计的对抗扰动影响而导致误分类。本工作中,我们提出一种受隐写术启发的白盒对抗攻击,可生成针对说话人识别模型的不可感知对抗扰动。我们的方法 FoolHD 使用在 DCT 域中运行的门控卷积自编码器,并以多目标损失函数训练,以在原始音频文件内生成并隐藏对抗扰动。除阻碍说话人识别性能外,该多目标损失通过从原始与对抗音频文件中提取的 MFCC 特征向量之间的逐帧余弦相似度来考虑人类感知。我们使用在 VoxCeleb 上训练的 250 说话人识别 x-vector 网络,从准确率、成功率和不可感知性方面验证了 FoolHD 的有效性。我们的结果表明,FoolHD 生成的对抗音频文件高度不可感知(平均 PESQ 分数高于 4.30),同时在非定向和定向设置下分别以 99.6% 和 99.2% 的成功率误导说话人识别模型。
引用
@article{arxiv.2011.08483,
title = {FoolHD: Fooling speaker identification by Highly imperceptible adversarial Disturbances},
author = {Ali Shahin Shamsabadi and Francisco Sepúlveda Teixeira and Alberto Abad and Bhiksha Raj and Andrea Cavallaro and Isabel Trancoso},
journal= {arXiv preprint arXiv:2011.08483},
year = {2021}
}
备注
https://fsepteixeira.github.io/FoolHD/