不可察觉的节奏后门攻击:探索用于在语音识别中嵌入不可检测漏洞的节奏变换
声音
2024-10-21 v3 人工智能
音频与语音处理
摘要
语音识别是人机交互的重要起点,近年来,深度学习模型在此任务中取得了卓越的成功。然而,当模型训练和私有数据提供者总是分离时,一些使深度神经网络(DNN)异常的安全威胁值得研究。近年来,典型的后门攻击已在语音识别系统中得到研究。现有的后门方法基于数据投毒。攻击者对良性语音频谱图添加一些合并的变化,或改变语音成分,如音高和音色。因此,投毒数据可以被人类听觉或自动深度算法检测到。为了提高数据投毒的隐蔽性,本文提出了一种非神经且快速的算法,称为随机频谱图节奏变换(RSRT)。该算法结合四个步骤来生成隐蔽的投毒话语。从节奏成分变换的角度来看,我们提出的触发器拉伸或压缩梅尔频谱图,并将其恢复为信号。该操作保持音色和内容不变,以实现良好的隐蔽性。我们的实验在两种语音识别任务上进行,包括通过说话人验证和自动语音识别测试投毒样本的隐蔽性。结果表明,我们的方法具有出色的有效性和隐蔽性。节奏触发器需要较低的投毒率,并能获得非常高的攻击成功率。
引用
@article{arxiv.2406.10932,
title = {Imperceptible Rhythm Backdoor Attacks: Exploring Rhythm Transformation for Embedding Undetectable Vulnerabilities on Speech Recognition},
author = {Wenhan Yao and Jiangkun Yang and Yongqiang He and Jia Liu and Weiping Wen},
journal= {arXiv preprint arXiv:2406.10932},
year = {2024}
}
备注
Accepted by Neurocomputing