音频对抗样本:利用人声掩码的攻击
声音
2021-02-09 v2 人工智能
音频与语音处理
摘要
我们在自动语音转文本(Speech-To-Text)系统上构造音频对抗样本。给定任意音频波形,我们通过叠加由原始音频生成的人声掩码来产生另一音频。我们将音频对抗攻击应用于五个 SOTA STT 系统:DeepSpeech、Julius、Kaldi、wav2letter@anywhere 和 CMUSphinx。此外,我们让人类标注者转写对抗音频。我们的实验表明,这些对抗样本欺骗了最先进的语音转文本系统,但人类能够稳定地辨认出语音。该攻击的可行性为研究机器与人类语音感知引入了新领域。
引用
@article{arxiv.2102.02417,
title = {Audio Adversarial Examples: Attacks Using Vocal Masks},
author = {Kai Yuan Tay and Lynnette Ng and Wei Han Chua and Lucerne Loke and Danqi Ye and Melissa Chua},
journal= {arXiv preprint arXiv:2102.02417},
year = {2021}
}
备注
9 pages, 1 figure, 2 tables. Submitted to COLING2020