利用MP3压缩削弱端到端语音识别中的对抗性噪声
音频与语音处理
2020-07-28 v1 密码学与安全
声音
摘要
音频对抗样本(AAE)是专门创建的输入,旨在诱使自动语音识别(ASR)系统产生错误分类。本文提出将MP3压缩作为一种手段,以降低ASR系统转录的音频样本中对抗性噪声(AN)的影响。为此,我们使用快速梯度符号法为一个端到端、混合CTC-注意力机制的ASR系统生成了AAE。然后,通过两个客观指标验证了我们的方法:(1)字符错误率(CER),用于衡量在未压缩和MP3压缩数据集上训练的四个ASR模型的语音解码性能;(2)信噪比(SNR),针对通过特征反演在时域重建的未压缩和MP3压缩的AAE进行估计。我们发现,与未压缩的AAE相比,对AAE应用MP3压缩确实降低了CER。此外,经过特征反演(重建)的AAE在MP3压缩后具有显著更高的SNR,这表明AN被削弱了。与AN相反,对添加了常规噪声的语音应用MP3压缩会导致更多的转录错误,这进一步证明了MP3编码仅对削弱AN有效。
引用
@article{arxiv.2007.12892,
title = {MP3 Compression To Diminish Adversarial Noise in End-to-End Speech Recognition},
author = {Iustina Andronic and Ludwig Kürzinger and Edgar Ricardo Chavez Rosas and Gerhard Rigoll and Bernhard U. Seeber},
journal= {arXiv preprint arXiv:2007.12892},
year = {2020}
}
备注
Submitted and accepted at SPECOM 2020 conference