中文

针对说话人识别系统的实时、通用且鲁棒的对抗攻击

音频与语音处理 2020-05-04 v2 计算与语言 声音

摘要

随着近年来语音用户界面(VUI)的普及,说话人识别系统已成为诸多安全性要求较高的应用与服务中辨识说话人的重要媒介。本文提出首个针对最先进的基于深度神经网络(DNN)的说话人识别系统的实时、通用且鲁棒的对抗攻击。通过在任意已注册说话人的语音输入上添加与音频无关的通用扰动,基于 DNN 的说话人识别系统会将说话人识别为任意目标(即攻击者期望的)说话人标签。此外,我们通过估计房间脉冲响应(RIR)来建模物理空中传播所致的声学失真,从而提升攻击的鲁棒性。使用包含 109 名英语说话人的公开数据集的实验表明,所提攻击具有高攻击成功率(超过 90%)的有效性与鲁棒性。攻击启动时间亦相较同期非通用攻击实现了 100 倍加速。

关键词

引用

@article{arxiv.2003.02301,
  title  = {Real-time, Universal, and Robust Adversarial Attacks Against Speaker Recognition Systems},
  author = {Yi Xie and Cong Shi and Zhuohang Li and Jian Liu and Yingying Chen and Bo Yuan},
  journal= {arXiv preprint arXiv:2003.02301},
  year   = {2020}
}

备注

Published as a conference paper at ICASSP 2020