中文

MORE:基于语音识别的多目标对抗攻击

音频与语音处理 2026-01-15 v2 人工智能 机器学习

摘要

大规模自动语音识别(ASR)模型如 Whisper 的出现极大扩展了其在各类实际应用中的采用范围。因此,确保即使在轻微输入扰动下也能保持鲁棒性,对于维持实时环境中的可靠性能至关重要。虽然先前工作主要考察了在对抗攻击下对准确率的降解,但针对效率的鲁棒性仍然基本未被探讨。这种狭隘的关注仅提供了对 ASR 模型脆弱性的部分理解。为填补这一空白,我们对 ASR 在多种攻击情景下的鲁棒性进行了全面研究。我们引入 MORE,即多目标重复加倍鼓励攻击,通过层级分阶段的排斥-锚定机制,联合降低识别准确率和推理效率。具体而言,我们将多目标对抗优化重新表述为层级框架,以顺序实现双重目标。为进一步放大效果,我们提出一种新颖的重复鼓励加倍目标(REDO),通过维持准确率降解并定期加倍预测序列长度,诱导重复文本生成。总体而言,MORE 通过单个对抗输入,迫使 ASR 模型在计算成本显著提高的情况下产生错误转录,尤其是生成长度显著增加且保持高词错率。实验表明,MORE 在多个基准上均显著优于现有方法,凸显了其在多目标对抗攻击中的有效性。

关键词

引用

@article{arxiv.2601.01852,
  title  = {MORE: Multi-Objective Adversarial Attacks on Speech Recognition},
  author = {Xiaoxue Gao and Zexin Li and Yiming Chen and Nancy F. Chen},
  journal= {arXiv preprint arXiv:2601.01852},
  year   = {2026}
}

备注

19 pages