SA:一种抗裁剪与自拼接的合成语音检测滑动攻击
声音
2022-10-13 v2 密码学与安全
音频与语音处理
摘要
深度神经网络易受对抗样本的攻击,后者以难以察觉的扰动误导模型。在音频领域,尽管对抗样本在白盒与黑盒设定下已取得极高的攻击成功率,多数现有对抗攻击受限于输入长度。更实际的场景是,对抗样本必须经过裁剪或自拼接后输入黑盒模型。因此,有必要探索如何在不同输入长度设定下提升可迁移性。本文以合成语音检测任务为例,考虑两种具代表性的 SOTA 模型。我们通过将样本裁剪或自拼接后输入模型并分析所得梯度,观察到相同样本值的片段在不同模型中的梯度相似。受上述观察启发,我们提出一种称为滑动攻击的新对抗攻击方法。具体而言,我们使每个采样点感知不同位置处的梯度,从而模拟对抗样本以不同输入长度输入黑盒模型的情形。因此,我们在梯度计算的每次迭代中不直接使用当前梯度,而是经历以下三步:首先,利用滑动窗口提取不同长度的子段;继而用相邻域数据增广子段;最后将子段输入不同模型以获得聚合梯度来更新对抗样本。实验结果表明,我们的方法在裁剪或自拼接后能显著提升对抗样本的可迁移性。此外,该方法也能增强基于不同特征的模型间的可迁移性。
引用
@article{arxiv.2208.13066,
title = {SA: Sliding attack for synthetic speech detection with resistance to clipping and self-splicing},
author = {Deng JiaCheng and Dong Li and Yan Diqun and Wang Rangding and Zeng Jiaming},
journal= {arXiv preprint arXiv:2208.13066},
year = {2022}
}
备注
Updated description and formula