SyntheticPop:针对合成语音的人工会话验证系统攻击
密码学与安全
2025-02-14 v1 机器学习
摘要
语音认证(VA)又称自动语音验证(ASV),是广泛采用的认证方法,尤其在自动化系统(如银行服务)中作为用户认证的第二层。尽管其受欢迎,但VA系统可能遭受各种攻击,包括重放攻击、冒充攻击以及新兴的深度伪造音频攻击,这些攻击模仿合法用户的语音。为缓解这些风险,已提出多种防御机制。其中一种解决方案是Voice Pops,旨在区分个体在注册过程中不同音素的独特发音。虽然Voice Pops有前景,但针对更广泛攻击(尤其是逻辑或对抗性攻击)的VA+Voice Pops系统有效性仍未得到充分探讨。我们提出了一种新型攻击方法,称为SyntheticPop,旨在针对VA+Voice Pops系统的音素识别能力。SyntheticPop攻击涉及将合成“噪声”嵌入到伪造音频样本中,显著降低模型性能。我们实现了超过95%的攻击成功率,同时感染了20%的训练数据集。我们的实验表明,在正常情况下VA+Voice Pops的准确率为69%,在基线标签翻转攻击下为37%,而在我们提出的SyntheticPop攻击下仅为14%,突显了该方法的有效性。
关键词
引用
@article{arxiv.2502.09553,
title = {SyntheticPop: Attacking Speaker Verification Systems With Synthetic VoicePops},
author = {Eshaq Jamdar and Amith Kamath Belman},
journal= {arXiv preprint arXiv:2502.09553},
year = {2025}
}