中文

基于伪孪生网络的说话人识别中保音色黑盒对抗攻击

声音 2023-05-31 v1 音频与语音处理

摘要

在本研究中,我们提出了一种用于说话人识别(SID)的保音色对抗攻击方法,该方法不仅在黑盒攻击设定下利用SID模型的弱点,还能保留目标说话人的音色。具体而言,我们在语音转换模型训练过程中加入对抗约束以生成保音色伪造音频。随后,我们利用伪孪生网络架构从黑盒SID模型中学习,同时约束内在相似性与结构相似性。内在相似性损失用于学习内在不变性,而结构相似性损失用于确保替代SID模型与固定的黑盒SID模型具有相似的决策边界。该替代模型可作为代理用于生成保音色伪造音频以实施攻击。在Audio Deepfake Detection(ADD)挑战数据集上的实验结果表明,我们所提方法在白盒与黑盒场景下的攻击成功率分别高达60.58%和55.38%,且能够同时欺骗人类与机器。

关键词

引用

@article{arxiv.2305.19020,
  title  = {Pseudo-Siamese Network based Timbre-reserved Black-box Adversarial Attack in Speaker Identification},
  author = {Qing Wang and Jixun Yao and Ziqian Wang and Pengcheng Guo and Lei Xie},
  journal= {arXiv preprint arXiv:2305.19020},
  year   = {2023}
}

备注

5 pages