去噪如何阻碍:以 SAM-Audio 和 Whisper 重访零样本语音识别
声音
2026-03-06 v1 人工智能
机器学习
摘要
近期语音识别和语音增强的进展导致广泛假设,即改善感知音频质量应直接有助于识别准确率。在本工作中,我们严格检验了这一假设是否适用于现代零样本语音识别系统。我们提出了一项系统性经验研究,考察 Meta 最近提出的规模化语音增强模型 SAM-Audio 作为零样本语音转换的预处理步骤的影响。实验在多个 Whisper 模型变体以及两个语言学差异显著的噪声语音数据集上进行:一个真实世界的孟加拉 YouTube 语料库和一个公开的英文噪声数据集。与常见直觉相反,我们的结果显示,SAM-Audio 预处理持续降低语音识别性能,其 Word Error Rate(WER)和 Character Error Rate(CER)均高于原始噪声语音,尽管信号水平质量得到了实质性改善。对英文数据集的客观峰值信噪比分析确认,SAM-Audio 产生的声学信号更干净,但这种改善未能转化为识别收益。因此,我们对该反直觉结果进行了详尽的 utterance 级别分析。我们发现,识别降解是系统性问题,影响绝大多数音频,而不仅仅是孤立的异常值;且随着 Whisper 模型规模的增大,错误也随之恶化。这些发现揭示了根本性的错位:对人类听者而言更清晰的音频,并不一定对机器识别robust。本研究凸显了在零样本语音识别管道中盲目应用最先进的去噪作为预处理步骤的风险。
引用
@article{arxiv.2603.04710,
title = {When Denoising Hinders: Revisiting Zero-Shot ASR with SAM-Audio and Whisper},
author = {Akif Islam and Raufun Nahar and Md. Ekramul Hamid},
journal= {arXiv preprint arXiv:2603.04710},
year = {2026}
}
备注
6 pages, 4 figures, 5 tables. IEEE Conference Paper