用于鲁棒混合CTC/注意力语音识别的音频对抗样本
音频与语音处理
2020-07-22 v1 声音
摘要
自动语音识别(ASR)的最新进展展示了端到端系统如何实现最先进的性能。存在向更深神经网络的趋势,然而这些ASR模型也更加复杂,并且容易受到特制噪声数据的攻击。这些音频对抗样本(AAE)先前已在使用连接主义时间分类(CTC)以及基于注意力的编码器-解码器架构的ASR系统上得到证明。遵循混合CTC/注意力ASR系统的思想,本文提出了生成AAE的算法,将两种方法结合为联合CTC-注意力梯度方法。使用混合CTC/注意力端到端ASR模型对两个参考句子作为案例研究,以及TEDlium v2语音识别任务进行评估。然后,我们展示了该算法在对抗训练中的应用,以获得更鲁棒的ASR模型。
引用
@article{arxiv.2007.10723,
title = {Audio Adversarial Examples for Robust Hybrid CTC/Attention Speech Recognition},
author = {Ludwig Kürzinger and Edgar Ricardo Chavez Rosas and Lujun Li and Tobias Watzel and Gerhard Rigoll},
journal= {arXiv preprint arXiv:2007.10723},
year = {2020}
}
备注
To be published at SPECOM 2020