中文

AS2T:针对说话人识别系统的任意源到目标对抗攻击

声音 2022-06-08 v1 密码学与安全 机器学习 音频与语音处理

摘要

近期的研究揭示了说话人识别系统(SRSs)面对对抗攻击的脆弱性,这在部署 SRSs 时引发了重大的安全担忧。然而,它们仅考虑了少数设定(例如源说话人与目标说话人的某些组合),而忽略了真实世界攻击场景中许多有趣且重要的设定。在本工作中,我们提出 AS2T,该领域中首个覆盖所有设定的攻击方法,从而允许攻击者针对任意三种主要识别任务,使用任意源说话人和目标说话人生成对抗语音。由于现有损失函数均无法应用于所有设定,我们为每个设定探索了多种候选损失函数,包括已有的和全新设计的。我们全面评估了它们的效能,发现一些已有损失函数是次优的。接着,为提高 AS2T 对实际空中(over-the-air)攻击的鲁棒性,我们研究了空中传输中可能出现的失真,利用具有不同参数的不同变换函数对这些失真建模,并将其融入对抗语音的生成中。我们的模拟空中评估验证了所提方案在生成鲁棒对抗语音上的有效性,这些语音在各种硬件设备以及具有不同混响、环境噪声和噪声水平的不同声学环境下依然有效。最后,我们利用 AS2T 进行了迄今为止最大规模的评估,以理解 14 种多样化 SRSs 之间的可迁移性。该可迁移性分析提供了许多有趣且有用的见解,对图像域先前工作中得出的若干发现和结论提出了挑战。我们的研究也为说话人识别域中对抗攻击的未来方向提供了启示。

关键词

引用

@article{arxiv.2206.03351,
  title  = {AS2T: Arbitrary Source-To-Target Adversarial Attack on Speaker Recognition Systems},
  author = {Guangke Chen and Zhe Zhao and Fu Song and Sen Chen and Lingling Fan and Yang Liu},
  journal= {arXiv preprint arXiv:2206.03351},
  year   = {2022}
}