中文

充耳不闻:通过多任务学习实现自动语音识别的对抗鲁棒性

音频与语音处理 2022-04-06 v1 机器学习

摘要

随着自动语音识别(ASR)系统正被广泛部署于实际环境中,对抗攻击日益增长的威胁引发了关于使用此类系统的安全性与可靠性的严重问题。另一方面,多任务学习(MTL)已在训练能抵抗计算机视觉领域对抗攻击的模型中显示出成功。在本工作中,我们研究在语音领域对此类多任务学习的执行对 ASR 模型对抗鲁棒性的影响。我们通过结合口音分类与 ASR 等语义多样任务进行广泛的 MTL 实验,并评估广泛的对抗设置。我们的透彻分析揭示,使用语义多样任务执行 MTL 持续使对抗攻击更难以成功。我们还详细讨论了对其 MTL 模型鲁棒性有显著影响的严重陷阱及其相关补救措施。我们提出的 MTL 方法在对抗定向词错率(WER)上相较单任务学习基线(分别为 attention 解码器与 CTC)显示出从 17.25 到 59.90 不等的显著绝对提升。我们的工作是首个深入揭示多任务学习为 ASR 带来对抗鲁棒性增益的研究。

关键词

引用

@article{arxiv.2204.02381,
  title  = {Hear No Evil: Towards Adversarial Robustness of Automatic Speech Recognition via Multi-Task Learning},
  author = {Nilaksh Das and Duen Horng Chau},
  journal= {arXiv preprint arXiv:2204.02381},
  year   = {2022}
}

备注

Submitted to Insterspeech 2022