中文

说话人识别中保留音色的有针对性对抗攻击

声音 2023-09-06 v1 音频与语音处理

摘要

作为一种生物特征识别,说话人识别(SID)系统面临多种攻击。欺骗攻击通常模仿目标说话人的音色,而对抗攻击通过对任意语音添加精心设计的对抗扰动来混淆SID系统。尽管欺骗攻击复制了与受害者相似的音色,但其未利用SID模型的漏洞,且可能无法使SID系统给出攻击者期望的判定。至于对抗攻击,虽可引导SID系统作出指定判定,却无法满足特定攻击场景中对指定文本或说话人音色的要求。在本研究中,为使SID中的攻击既能利用SID模型的漏洞又能保留目标说话人的音色,我们提出一种说话人识别中保留音色的对抗攻击。我们在语音转换(VC)模型的不同训练阶段通过添加对抗约束来生成保留音色的对抗音频。具体地,该对抗约束使用目标说话人标签来优化添加至VC模型表示的对抗扰动,并通过在VC模型训练中引入说话人分类器来实现。该对抗约束有助于控制VC模型生成说话人相关的音频。最终,VC模型的推理即为理想的对抗伪造音频,其保留音色且能欺骗SID系统。

关键词

引用

@article{arxiv.2309.00929,
  title  = {Timbre-reserved Adversarial Attack in Speaker Identification},
  author = {Qing Wang and Jixun Yao and Li Zhang and Pengcheng Guo and Lei Xie},
  journal= {arXiv preprint arXiv:2309.00929},
  year   = {2023}
}

备注

11 pages, 8 figures