中文

重新审视鲁棒 ASR 的声学特征

声音 2024-09-26 v1 计算与语言 音频与语音处理

摘要

自动语音识别(ASR)系统必须对真实世界环境中存在的各种噪声具有鲁棒性,包括环境噪声、房间脉冲响应、特殊效果以及恶意行为者的攻击(对抗攻击)。近期的工作试图通过开发新型深度神经网络(DNN)并为它们策划多样化的训练数据集来提高准确性和鲁棒性,同时使用相对简单的声学特征。虽然这种方法提高了对训练数据中存在的噪声类型的鲁棒性,但它对未见噪声的鲁棒性有限,对对抗攻击的鲁棒性微乎其微。在本文中,我们重新审视早期工作的方法,开发受生物听觉感知启发的声学特征,可用于执行准确且鲁棒的 ASR。具体而言,我们评估了几种受生物学启发的声学特征的 ASR 准确性和鲁棒性。除了先前工作中的几种特征(如伽马通滤波器组特征(GammSpec))外,我们还提出了两种新的声学特征,称为频率掩蔽频谱图(FreqMask)和伽马通差分频谱图(DoGSpec),以模拟频率掩蔽和侧抑制的神经心理现象。在多样化模型和数据集上的实验表明:(1)DoGSpec 在准确率损失极小的情况下,实现了比高度流行的对数梅尔频谱图(LogMelSpec)显著更好的鲁棒性;(2)GammSpec 在 Speech Robust Bench 基准测试中对非对抗性噪声实现了更好的准确性和鲁棒性,但在对抗攻击下其表现不如 DoGSpec。

关键词

引用

@article{arxiv.2409.16399,
  title  = {Revisiting Acoustic Features for Robust ASR},
  author = {Muhammad A. Shah and Bhiksha Raj},
  journal= {arXiv preprint arXiv:2409.16399},
  year   = {2024}
}

备注

submitted to ICASSP 2025