中文

DiffAttack:基于扩散的音色保留对抗攻击用于说话人识别

声音 2025-01-10 v1 音频与语音处理

摘要

作为一种生物识别形式,说话人识别 (SID) 系统的安全性至关重要。为更好地理解 SID 系统的鲁棒性,我们旨在执行更真实的 SID 攻击,这些攻击对人类和机器都难以察觉。本研究提出了 DiffAttack,一种新颖的音色保留对抗攻击方法,利用基于扩散的语音转换 (DiffVC) 模型生成带有特定目标说话人属性的对抗性伪造音频。通过在基于扩散的语音转换模型的生成过程中引入对抗约束,我们构建有效误导目标模型的假样本,同时保留说话人特征。具体而言,灵感来自常规对抗攻击和扩散过程中随机采样高斯噪声的用法,我们将对抗约束纳入逆扩散过程中,这些约束微观地引导逆扩散过程以匹配目标说话人分布。我们在 LibriTTS 数据集上的实验表明,DiffAttack 在攻击成功率方面显著优于基础 DiffVC 和其他方法。此外,客观和主观评估表明,引入对抗约束并不会损害 DiffVC 模型生成的语音质量。

关键词

引用

@article{arxiv.2501.05127,
  title  = {DiffAttack: Diffusion-based Timbre-reserved Adversarial Attack in Speaker Identification},
  author = {Qing Wang and Jixun Yao and Zhaokai Sun and Pengcheng Guo and Lei Xie and John H. L. Hansen},
  journal= {arXiv preprint arXiv:2501.05127},
  year   = {2025}
}

备注

5 pages,4 figures, accepted by ICASSP 2025