基于对抗性超声波的注册阶段说话人识别系统后门攻击
声音
2023-12-12 v2 密码学与安全
音频与语音处理
摘要
自动说话人识别系统(SRS)已广泛应用于语音应用中的个人身份识别与访问控制。典型的SRS包含三个阶段,即训练、注册和识别。已有工作表明,SRS可在训练阶段被后门攻击绕过,或在识别阶段被对抗样本攻击绕过。本文提出Tuner,一种针对SRS注册阶段、基于对抗性超声波调制的新型后门攻击,其具有不可听、无需同步、与内容无关和黑盒的特性。我们的核心思想是:在合法用户发起注册时,先用调制超声波将后门注入SRS,此后被污染的SRS将以高置信度同时放行合法用户与攻击者。我们的攻击面临注册阶段用户发音不可预测的主要挑战。为克服该挑战,我们通过随机语音内容、用户发声时间与音量来增强优化过程,从而生成超声波后门。此外,为实现现实世界的鲁棒性,我们采用稀疏频点、预补偿与单边带(SSB)调制对传统方法的超声波信号进行改进。我们在两个常用数据集、七种代表性SRS模型上广泛评估Tuner,并测试其针对七类防御的鲁棒性。结果表明,我们的攻击可成功绕过说话人识别系统,且对各类说话人、语音内容等保持有效。为缓解这一新发现的威胁,我们还对该新威胁的潜在对策、局限性与未来工作进行了讨论。
引用
@article{arxiv.2306.16022,
title = {Enrollment-stage Backdoor Attacks on Speaker Recognition Systems via Adversarial Ultrasound},
author = {Xinfeng Li and Junning Ze and Chen Yan and Yushi Cheng and Xiaoyu Ji and Wenyuan Xu},
journal= {arXiv preprint arXiv:2306.16022},
year = {2023}
}
备注
Published in Internet of Things Journal (IoT-J)