面向语音识别的基于声音要素的隐蔽后门攻击
声音
2023-07-18 v1 密码学与安全
机器学习
音频与语音处理
摘要
深度神经网络(DNNs)已广泛且成功地应用于语音识别的各种场景中。近期,少数工作揭示这些模型易受后门攻击,攻击者可通过毒化训练过程将恶意预测行为植入受害模型。本文重新审视针对语音识别的仅投毒后门攻击。我们揭示现有方法不够隐蔽,因其触发模式可被人类或机器检测感知。该局限主要源于其触发模式为简单噪声或可分离且独特的片段。受这些发现启发,我们提出利用声音要素(如音高与音色)设计更隐蔽且有效的仅投毒后门攻击。具体而言,我们插入短时高音信号作为触发器,并提升其余音频片段的音高以“掩盖”它,从而设计基于音高的隐蔽触发器。我们操纵受害音频的音色特征以设计基于音色的隐蔽攻击,并设计声纹选择模块以促进多后门攻击。我们的攻击能生成更“自然”的投毒样本,因而更为隐蔽。我们在基准数据集上进行了大量实验,验证了我们的攻击在不同设置(如全到一、全到全、干净标签、物理及多后门设置)下的有效性与隐蔽性。复现主要实验的代码见 \url{https://github.com/HanboCai/BadSpeech_SoE}。
引用
@article{arxiv.2307.08208,
title = {Towards Stealthy Backdoor Attacks against Speech Recognition via Elements of Sound},
author = {Hanbo Cai and Pengcheng Zhang and Hai Dong and Yan Xiao and Stefanos Koffas and Yiming Li},
journal= {arXiv preprint arXiv:2307.08208},
year = {2023}
}
备注
13 pages